soniqo/speech-swift
AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML
Speech Swift – Apple Silicon 專用的設備端語音 AI
是什麼
- 一個 Swift 套件,整合大量現代語音相關模型(ASR、TTS、對齊、翻譯、語音代理、增強等),可在 Mac 與 iOS 設備上本地執行。
- 使用 Apple 的 Core ML 執行環境(含神經引擎)與開源的 MLX 框架執行模型,無需任何雲端服務或 API 金鑰。
為何重要
- 所有處理皆在裝置上完成,因此可維持隱私、避免延遲,並支援離線運作。
- 支援極廣的語言範圍(Omnilingual ASR 最多支援 1,672 種語言),涵蓋從簡單語音輸入到全雙工語音對話代理的多種任務。
- 模型提供多種量化形式(FP16、INT8、INT5、INT4 等),可依目標硬體在速度、記憶體與品質之間權衡。
核心功能
| 類別 | 例子模型(大小) | 功能 |
|---|---|---|
| 語音轉文字(ASR) | Qwen3‑ASR(0.6‑1.7 B)、Whisper‑ASR(Large‑v3 Turbo)、Omnilingual(300 M‑7 B,1,672 語言) | 將音訊轉為文字,支援可選的說話人分離與時間戳。 |
| 對齊 | Qwen3‑ForcedAligner(0.6 B) | 為給定轉錄文字產生詞級時間戳。 |
| 文字轉語音(TTS) | Qwen3‑TTS(0.6‑1.7 B)、CosyVoice(0.5 B)、Kokoro(82 M) | 產生自然語音,支援語音克隆與情感標籤。 |
| LLM 與翻譯 | Qwen3Chat(0.8‑4 B)、FunctionGemma(270 M)、MADLAD‑400(3 B) | 在本地執行語言模型;支援 400+ 種語言間翻譯。 |
| 語音轉語音 / 語音代理 | PersonaPlex(7 B)、VoiceChat(11 B) | 全雙工音訊輸入/輸出代理,亦可執行工具呼叫 LLM。 |
| 增強與分離 | DeepFilterNet3(2.1 M)、Source‑Separation(HTDemucs/UMX)、FlashSR(音訊超解析度) | 去噪、去回音、分離音樂音軌、上採樣音訊。 |
| 說話人切換檢測與分離 | Wake‑word、VAD、Smart‑Turn、Speaker Diarisation | 檢測使用者何時開始/結束說話,以及誰在說話。 |
如何加入
// 在 Package.swift 中
.package(url: "https://github.com/soniqo/speech-swift", branch: "main")
然後僅導入你需要的部分,例如:
import ParakeetStreamingASR // 流式 ASR
import SpeechUI // 可選的 SwiftUI 工具
快速程式碼範例 – 轉錄音訊緩衝區
import ParakeetStreamingASR
let model = try await ParakeetStreamingASRModel.fromPretrained()
let text = try model.transcribeAudio(audioSamples, sampleRate: 16_000)
print(text)
同一模型亦可用於即時串流:
for await part in model.transcribeStream(audio: samples, sampleRate: 16_000) {
print(part.isFinal ? "FINAL: \(part.text)" : "… \(part.text)")
}
一個極小的 SwiftUI 視圖(SpeechUI)可在約 10 行程式碼內將語音輸入 UI 加入應用中。
生態系統與社群
- 文件 – 完整指南見 https://soniqo.audio(模型特定頁面、基準表格、部署技巧)。
- 預訓練模型 – 在 Hugging Face 上由
aufklarer組織托管。 - 部落格與 Discord – 定期發布效能技巧、新模型發布資訊,以及支援用 Discord 伺服器。
- Homebrew – 透過
brew install speech安裝命令列工具。 - 已驗證的下游專案 – 16 個公開倉儲(如 AnythingLLM、Voicey、DexDictate)已依賴 Speech Swift。
典型應用場景
- 完全在裝置上運作的語音助理(無網路呼叫)。
- 為記者、播客製作者或無障礙工具設計的轉錄應用。
- 播客旁白、有聲書或遊戲內 NPC 語音等音訊生成。
- 低延遲語音到語音翻譯的即時通訊。
- 噪音抑制、回音消除、音源分離等音訊後處理。
效能 在 iPhone 16 Pro、Core ML 環境下的基準測試顯示,串流語音輸入的即時因子低至 0.04 RTF,高品質 TTS 為 0.08 RTF,表示模型處理音訊的速度快於錄製速度。
授權 大多數模型採用寬鬆授權(Apache‑2.0、MIT)或非商業研究授權發布;Swift 套件本身採用 MIT 授權開源。
總結 – Speech Swift 是一個全面、可投入生產的工具箱,將最新的語音 AI 功能帶入 Apple 設備,且全程不離開裝置,非常適合需要高品質語音識別、合成、翻譯或語音代理功能的隱私優先應用。
相關
- 專案
- 專案
- 專案
- 專案
- 專案