argmaxinc/argmax-oss-swift

On-device Speech AI for Apple Silicon

解決的問題

Argmax Open-Source SDK 提供了一套開箱即用的框架,可在 Apple 平台(macOS 和 iOS)上完全在裝置端執行 AI 音訊模型。它消除了對語音轉文字、文字轉語音和說話人識別雲端 API 的需求,確保了隱私並降低了延遲。

工作原理

該 SDK 基於 Core ML 構建,由三個專門的「套件」組成:

  • WhisperKit:實現 OpenAI 的 Whisper 用於語音轉文字轉錄和翻譯。它包含一個模擬 OpenAI Audio API 的本地伺服器,以便與現有用戶端輕鬆整合。

  • TTSKit:使用 Qwen3-TTS 模型將文字轉換為語音,支援多種語言、自定義聲音和即時串流播放。

  • SpeakerKit:利用 Pyannote 進行說話人日誌,允許系統識別音訊錄製中「誰在何時說話」。

適用對象

正在為 macOS 和 iOS 進行開發,並希望將高性能音訊 AI 能力(如轉錄、語音合成和說話人識別)直接整合到應用中,而不依賴外部伺服器的開發者。

亮點

  • 端側推理:所有處理均透過 Core ML 在 Apple silicon 上本地完成。
  • OpenAI API 相容性:包含一個本地伺服器,允許開發者使用標準的 OpenAI SDK 用戶端進行本地轉錄。
  • 串流能力:支援 TTS 的即時串流播放,以及 WhisperKit 中用於管理記憶體的大型音訊檔案增量載入。
  • 多語言支援:TTSKit 支援 10 種語言和多種內建聲音;WhisperKit 支援用於不同精度/速度權衡的各種模型大小。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案