soniqo/speech-swift
AI speech toolkit for Apple Silicon — ASR, TTS, speech-to-speech, VAD, and diarization powered by MLX and CoreML
解決する課題
Speech Swiftは、MacおよびiOSデバイス上で高性能なローカルAI音声処理を可能にします。クラウド処理やAPIキーを必要としないため、オーディオデータがユーザーのデバイスから外部に出ることはなく、リアルタイムアプリケーション向けの低遅延な機能を提供します。
仕組み
MLX SwiftとCoreMLを使用して構築されたこのライブラリにより、開発者はApple Silicon(Neural Engineを含む)上でさまざまな特化型モデルを直接実行できます。モジュール方式を採用しているため、特定のASR、TTS、またはLLMモジュールなど、必要なSPM (Swift Package Manager) プロダクトのみをインポートできます。
対象者
- プライバシーを重視した音声エージェントや文字起こしツールを構築する iOSおよびmacOS開発者
- 高性能なオンデバイス音声認識 (STT)、テキスト読み上げ (TTS)、音声変換機能を求める AIエンジニア
- クラウドに依存せずに、リアルタイムのディクテーション、ボイスクローニング、またはオーディオ拡張機能が必要な アプリ開発者
ハイライト
- 包括的な音声スイート: 自動音声認識 (ASR)、テキスト読み上げ (TTS)、音声対音声翻訳、およびオーディオ拡張をサポート。
- オンデバイスのプライバシー: すべての処理はローカルで行われ、データのセキュリティとオフライン機能を保証します。
- 広範なモデルサポート: Whisper、Qwen、Kokoroなど、数百の言語をカバーする多くの実装が含まれています。
- モジュール式アーキラテクチャ: Swift Package Managerの統合により、必要なモジュールのみをインポートして軽量なビルドが可能です。
- 高いパフォーマンス: Apple Silicon向けに最適化されており、Neural Engineを活用して低遅延のストリーミングと高いリアルタイム係数 (RTF) の効率を実現します。