soniqo/speech-swift

AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML

解決する課題

Speech Swiftは、MacおよびiOSデバイス上で高性能なローカルAI音声処理を可能にします。クラウド処理やAPIキーを必要としないため、オーディオデータがユーザーのデバイスから外部に出ることはなく、リアルタイムアプリケーション向けの低遅延な機能を提供します。

仕組み

MLX SwiftとCoreMLを使用して構築されたこのライブラリにより、開発者はApple Silicon(Neural Engineを含む)上でさまざまな特化型モデルを直接実行できます。モジュール方式を採用しているため、特定のASR、TTS、またはLLMモジュールなど、必要なSPM (Swift Package Manager) プロダクトのみをインポートできます。

対象者

  • プライバシーを重視した音声エージェントや文字起こしツールを構築する iOSおよびmacOS開発者
  • 高性能なオンデバイス音声認識 (STT)、テキスト読み上げ (TTS)、音声変換機能を求める AIエンジニア
  • クラウドに依存せずに、リアルタイムのディクテーション、ボイスクローニング、またはオーディオ拡張機能が必要な アプリ開発者

ハイライト

  • 包括的な音声スイート: 自動音声認識 (ASR)、テキスト読み上げ (TTS)、音声対音声翻訳、およびオーディオ拡張をサポート。
  • オンデバイスのプライバシー: すべての処理はローカルで行われ、データのセキュリティとオフライン機能を保証します。
  • 広範なモデルサポート: Whisper、Qwen、Kokoroなど、数百の言語をカバーする多くの実装が含まれています。
  • モジュール式アーキラテクチャ: Swift Package Managerの統合により、必要なモジュールのみをインポートして軽量なビルドが可能です。
  • 高いパフォーマンス: Apple Silicon向けに最適化されており、Neural Engineを活用して低遅延のストリーミングと高いリアルタイム係数 (RTF) の効率を実現します。