FluidInference/FluidAudio
Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.
What it solves
FluidAudioは、Appleデバイス上で完全にローカルかつ低遅延なオーディオAIを実現するSwift SDKです。クラウドベースのオーディオ処理への依存という問題を、推論をApple Neural Engine (ANE) にオフロードすることで解決します。これにより、メモリ使用量の削減、消費電力の低下、および速度の向上を実現しながら、ユーザーのプライバシーを維持します。
How it works
このSDKは、ANE上で直接動作する最適化されたオープンソースモデル (MIT/Apache 2.0) を統合しています。これにより、CPUやGPU/MPSを完全に回避できます。以下のようないくつかのオーディオタスクに対して、統一されたインターフェースを提供します:
- Automatic Speech Recognition (ASR): Parakeet TDTやSenseVoiceなどのモデルを使用して、複数の言語にわたるバッチおよびストリーミング文字起こしをサポートします。
- Text-to-Speech (TTS): KokoroやPocketTTSを介した、ボイスクローニングを伴う並列合成およびストリーミングTTSを提供します。
- Speaker Diarization: オーディオストリーム内の異なる話者を分離・特定するための、オンラインおよびオフラインのパイプラインを提供します。
- Voice Activity Detection (VAD): Sileroモデルを使用して、音声が発生しているタイミングを検出します。
Who it’s for
会議アシスタント、ディクテーションツール、音声制御インターフェースなど、プライバシー重視のオフラインオーディオアプリケーションを構築したいmacOSおよびiOS開発者向けに設計されています。
Highlights
- Apple Neural Engine Optimization: ANE上で推論を実行することで、最大級のパフォーマンスと最小限の消費電力を実現します。
- Comprehensive Audio Suite: ASR、TTS、話者分離、およびVADを一つのSDKに含んでいます。
- Multilingual Support: 英語、欧州言語、日本語、および中国語を含む数十の言語にわたる文字起こしと合成をサポートします。
- Local-First Architecture: 完全にオフラインの処理により、データのプライバシーを確保し、クラウドの遅延を排除します。
- Extensible Integration: Swift packageとして利用可能であり、React Native/ExpoおよびRust/Tauri用の公式ラッパーも提供されています。