argmaxinc/argmax-oss-swift

On-device Speech AI for Apple Silicon

What it solves

Argmax Open-Source SDK は、Apple プラットフォーム(macOS と iOS)向けに AI 音声モデルをデバイス上で完全に実行するための、ターンキーなフレームワーク群を提供します。文字起こし、音声合成、話者識別といった一般的な音声タスクにクラウド API を使用する必要がなくなり、レイテンシが低減しプライバシーが向上します。

How it works

SDK は Core ML 上に構築された 3 つの専門キットのコレクションで、Apple Silicon 上で最適化されたモデルを実行します。

  • WhisperKit: OpenAI の Whisper を実装し、音声からテキストへの文字起こしと翻訳を行います。
  • TTSKit: Qwen‑TTS モデルを使用してテキストから音声への生成を行い、リアルタイムストリーミング再生と自然言語スタイル指示をサポートします。
  • SpeakerKit: Pyannote を利用して話者ダイアリゼーション(誰がいつ話したかの特定)を実現します。

Swift CLI が同梱されており、テストやローカルサーバーとして OpenAI Audio API をエミュレートできます。これにより、既存の OpenAI 互換クライアントを使ってデバイス上の機能を簡単に統合できます。

Who it’s for

iOS と macOS 向けアプリを開発する Apple デベロッパーで、外部サーバーに依存せず高品質な音声認識、音声合成、または話者ダイアリゼーションを組み込みたい方。

Highlights

  • On-Device Inference: Core ML を介して Apple Silicon 上で完全に実行されます。
  • OpenAI API Compatibility: OpenAI Audio API を実装したローカルサーバーが含まれており、統合が容易です。
  • Real-Time Streaming: TTSKit は生成される音声をフレーム単位で再生できます。
  • Multilingual Support: 文字起こしと音声合成の両方で幅広い言語をサポートします。
  • Flexible Model Selection: 速度と精度のバランスを取るために、Tiny から Large まで様々なモデルサイズを提供します。