soniqo/speech-swift

AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML

解决的问题

Speech Swift 能够在 Mac 和 iOS 设备上实现高性能的本地 AI 语音处理。它无需云端处理或 API 密钥,在确保音频数据绝不离开用户设备的同时,为实时应用提供低延迟能力。

工作原理

该库基于 MLX Swift 和 CoreML 构建,允许开发者直接在 Apple Silicon(包括神经网络引擎 Neural Engine)上运行各种专用模型。它是模块化的,允许开发者仅导入所需的特定 SPM (Swift Package Manager) 产品,例如特定的 ASR、TTS 或 LLM 模块。

适用对象

  • 构建注重隐私的语音代理或转录工具的 iOS 和 macOS 开发者
  • 寻求高性能、设备端语音转文本 (STT)、文本转语音 (TTS) 和语音转语音能力的 AI 工程师
  • 需要无需依赖云端的实时听写、声音克隆或音频增强功能的 应用创作者

亮点

  • 全面的语音套件:支持自动语音识别 (ASR)、文本转语音 (TTS)、语音对语音翻译和音频增强。
  • 设备端隐私:所有处理均在本地完成,确保数据安全和离线功能。
  • 广泛的模型支持:包括 Whisper、Qwen、Kokoro 等多种实现,覆盖数百种语言。
  • 模块化架构:通过 Swift Package Manager 集成,允许仅导入必要的模块来实现轻量化构建。
  • 高性能:针对 Apple Silicon 进行了优化,利用神经网络引擎实现低延迟流式传输和高实时率 (RTF) 效率。