FluidInference/FluidAudio

Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.

What it solves

FluidAudioは、Appleデバイス上で完全にローカルかつ低遅延なオーディオAIを実現するSwift SDKです。クラウドベースのオーディオ処理への依存という問題を、推論をApple Neural Engine (ANE) にオフロードすることで解決します。これにより、メモリ使用量の削減、消費電力の低下、および速度の向上を実現しながら、ユーザーのプライバシーを維持します。

How it works

このSDKは、ANE上で直接動作する最適化されたオープンソースモデル (MIT/Apache 2.0) を統合しています。これにより、CPUやGPU/MPSを完全に回避できます。以下のようないくつかのオーディオタスクに対して、統一されたインターフェースを提供します:

  • Automatic Speech Recognition (ASR): Parakeet TDTやSenseVoiceなどのモデルを使用して、複数の言語にわたるバッチおよびストリーミング文字起こしをサポートします。
  • Text-to-Speech (TTS): KokoroやPocketTTSを介した、ボイスクローニングを伴う並列合成およびストリーミングTTSを提供します。
  • Speaker Diarization: オーディオストリーム内の異なる話者を分離・特定するための、オンラインおよびオフラインのパイプラインを提供します。
  • Voice Activity Detection (VAD): Sileroモデルを使用して、音声が発生しているタイミングを検出します。

Who it’s for

会議アシスタント、ディクテーションツール、音声制御インターフェースなど、プライバシー重視のオフラインオーディオアプリケーションを構築したいmacOSおよびiOS開発者向けに設計されています。

Highlights

  • Apple Neural Engine Optimization: ANE上で推論を実行することで、最大級のパフォーマンスと最小限の消費電力を実現します。
  • Comprehensive Audio Suite: ASR、TTS、話者分離、およびVADを一つのSDKに含んでいます。
  • Multilingual Support: 英語、欧州言語、日本語、および中国語を含む数十の言語にわたる文字起こしと合成をサポートします。
  • Local-First Architecture: 完全にオフラインの処理により、データのプライバシーを確保し、クラウドの遅延を排除します。
  • Extensible Integration: Swift packageとして利用可能であり、React Native/ExpoおよびRust/Tauri用の公式ラッパーも提供されています。