argmaxinc/argmax-oss-swift

On-device Speech AI for Apple Silicon

What it solves

Argmax Open-Source SDK 為 Apple 平台(macOS 與 iOS)提供了一套可直接在裝置上執行 AI 音訊模型的即插即用框架。它消除對雲端 API 的需求,適用於轉錄、語音合成與說話者辨識等常見音訊任務,從而實現更低的延遲與更好的隱私保護。

How it works

SDK 是基於 Core ML 建構的三個專用 “Kit” 的集合,可在 Apple Silicon 上執行最佳化的模型:

  • WhisperKit:實作 OpenAI 的 Whisper,用於語音轉文字的轉錄與翻譯。
  • TTSKit:使用 Qwen‑TTS 模型進行文字轉語音生成,支援即時串流播放與自然語言風格指令。
  • SpeakerKit:利用 Pyannote 進行說話者分割(辨識誰在何時說話)。

SDK 包含一個 Swift CLI 用於測試,亦提供一個本地伺服器,模擬 OpenAI Audio API,開發者可以使用現有相容 OpenAI 的客戶端輕鬆整合這些裝置端功能。

Who it’s for

面向在 iOS 與 macOS 上開發應用的 Apple 開發者,想要在不依賴外部伺服器的情況下整合高品質的語音轉文字、文字轉語音或說話者分割功能。

Highlights

  • On-Device Inference:透過 Core ML 完全在 Apple Silicon 上執行。
  • OpenAI API Compatibility:內建實作 OpenAI Audio API 的本地伺服器,便於整合。
  • Real-Time Streaming:TTSKit 支援邊產生邊進行框架級音訊播放。
  • Multilingual Support:支援多語言的轉錄與語音合成。
  • Flexible Model Selection:提供從 Tiny 到 Large 的多種模型尺寸,以平衡速度與準確度。