soniqo/speech-swift

AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML

Speech Swift – Apple Silicon 專用的設備端語音 AI

是什麼

  • 一個 Swift 套件,整合大量現代語音相關模型(ASR、TTS、對齊、翻譯、語音代理、增強等),可在 Mac 與 iOS 設備上本地執行。
  • 使用 Apple 的 Core ML 執行環境(含神經引擎)與開源的 MLX 框架執行模型,無需任何雲端服務或 API 金鑰。

為何重要

  • 所有處理皆在裝置上完成,因此可維持隱私、避免延遲,並支援離線運作。
  • 支援極廣的語言範圍(Omnilingual ASR 最多支援 1,672 種語言),涵蓋從簡單語音輸入到全雙工語音對話代理的多種任務。
  • 模型提供多種量化形式(FP16、INT8、INT5、INT4 等),可依目標硬體在速度、記憶體與品質之間權衡。

核心功能

類別 例子模型(大小) 功能
語音轉文字(ASR) Qwen3‑ASR(0.6‑1.7 B)、Whisper‑ASR(Large‑v3 Turbo)、Omnilingual(300 M‑7 B,1,672 語言) 將音訊轉為文字,支援可選的說話人分離與時間戳。
對齊 Qwen3‑ForcedAligner(0.6 B) 為給定轉錄文字產生詞級時間戳。
文字轉語音(TTS) Qwen3‑TTS(0.6‑1.7 B)、CosyVoice(0.5 B)、Kokoro(82 M) 產生自然語音,支援語音克隆與情感標籤。
LLM 與翻譯 Qwen3Chat(0.8‑4 B)、FunctionGemma(270 M)、MADLAD‑400(3 B) 在本地執行語言模型;支援 400+ 種語言間翻譯。
語音轉語音 / 語音代理 PersonaPlex(7 B)、VoiceChat(11 B) 全雙工音訊輸入/輸出代理,亦可執行工具呼叫 LLM。
增強與分離 DeepFilterNet3(2.1 M)、Source‑Separation(HTDemucs/UMX)、FlashSR(音訊超解析度) 去噪、去回音、分離音樂音軌、上採樣音訊。
說話人切換檢測與分離 Wake‑word、VAD、Smart‑Turn、Speaker Diarisation 檢測使用者何時開始/結束說話,以及誰在說話。

如何加入

// 在 Package.swift 中
.package(url: "https://github.com/soniqo/speech-swift", branch: "main")

然後僅導入你需要的部分,例如:

import ParakeetStreamingASR   // 流式 ASR
import SpeechUI               // 可選的 SwiftUI 工具

快速程式碼範例 – 轉錄音訊緩衝區

import ParakeetStreamingASR

let model = try await ParakeetStreamingASRModel.fromPretrained()
let text  = try model.transcribeAudio(audioSamples, sampleRate: 16_000)
print(text)

同一模型亦可用於即時串流:

for await part in model.transcribeStream(audio: samples, sampleRate: 16_000) {
    print(part.isFinal ? "FINAL: \(part.text)" : "… \(part.text)")
}

一個極小的 SwiftUI 視圖(SpeechUI)可在約 10 行程式碼內將語音輸入 UI 加入應用中。

生態系統與社群

  • 文件 – 完整指南見 https://soniqo.audio(模型特定頁面、基準表格、部署技巧)。
  • 預訓練模型 – 在 Hugging Face 上由 aufklarer 組織托管。
  • 部落格與 Discord – 定期發布效能技巧、新模型發布資訊,以及支援用 Discord 伺服器。
  • Homebrew – 透過 brew install speech 安裝命令列工具。
  • 已驗證的下游專案 – 16 個公開倉儲(如 AnythingLLM、Voicey、DexDictate)已依賴 Speech Swift。

典型應用場景

  • 完全在裝置上運作的語音助理(無網路呼叫)。
  • 為記者、播客製作者或無障礙工具設計的轉錄應用。
  • 播客旁白、有聲書或遊戲內 NPC 語音等音訊生成。
  • 低延遲語音到語音翻譯的即時通訊。
  • 噪音抑制、回音消除、音源分離等音訊後處理。

效能 在 iPhone 16 Pro、Core ML 環境下的基準測試顯示,串流語音輸入的即時因子低至 0.04 RTF,高品質 TTS 為 0.08 RTF,表示模型處理音訊的速度快於錄製速度。

授權 大多數模型採用寬鬆授權(Apache‑2.0、MIT)或非商業研究授權發布;Swift 套件本身採用 MIT 授權開源。


總結 – Speech Swift 是一個全面、可投入生產的工具箱,將最新的語音 AI 功能帶入 Apple 設備,且全程不離開裝置,非常適合需要高品質語音識別、合成、翻譯或語音代理功能的隱私優先應用。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案