soniqo/speech-swift
AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML
解決的問題
Speech Swift 能夠在 Mac 和 iOS 裝置上實現高性能的本地 AI 語音處理。它無需雲端處理或 API 金鑰,在確保音訊數據絕不離開使用者裝置的同時,為即時應用提供低延遲能力。
工作原理
該函式庫基於 MLX Swift 和 CoreML 构建,允許開發者直接在 Apple Silicon(包括神經網路引擎 Neural Engine)上執行各種專用模型。它是模組化的,允許開發者僅匯入所需的特定 SPM (Swift Package Manager) 產品,例如特定的 ASR、TTS 或 LLM 模組。
適用對象
- 建構注重隱私的語音代理或轉錄工具的 iOS 與 macOS 開發者
- 尋求高性能、裝置端語音轉文字 (STT)、文字轉語音 (TTS) 與語音轉語音能力的 AI 工程師
- 需要無需依賴雲端的即時聽寫、聲音克隆或音訊增強功能的 應用程式創作者
亮點
- 全面的語音套件:支援自動語音辨識 (ASR)、文字轉語音 (TTS)、語音對語音翻譯與音訊增強。
- 裝置端隱私:所有處理均在本地完成,確保數據安全與離線功能。
- 廣泛的模型支援:包含 Whisper、Qwen、Kokoro 等多種實作,涵蓋數百種語言。
- 模組化架構:透過 Swift Package Manager 整合,允許僅匯入必要的模組以實現輕量化建置。
- 高性能:針對 Apple Silicon 進行優化,利用神經網路引擎實現低延遲串流與高即時率 (RTF) 效率。