FluidInference/FluidAudio
Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.
解決する課題
FluidAudioは、開発者が高性能かつ完全にローカルなオーディオAI機能をAppleデバイス(macOSおよびiOS)に統合できるようにするSwift SDKです。クラウドベースのオーディオ処理の必要性を排除し、推論をApple Neural Engine (ANE) にオフロードすることでプライバシーを確保し、レイテンシを削減します。
仕組み
このSDKは、ANE上で直接実行される最適化されたCoreMLモデルのセットを提供し、CPUとGPUを回避することで消費電力とメモリ使用量を最小限に抑えます。Swift Package ManagerまたはReact NativeおよびRust/Tauriの公式ラッパーを介してプロジェクトに追加できる、さまざまなオーディオタスク用のオープンソースモデルを統合しています。
対象者
リアルタイムまたはバッチのオーディオ処理を必要とするアプリを構築するAppleプラットフォーム開発者(ディテーションツール、会議アシスタント、音声制御インターフェースなど)向けに設計されています。
ハイライト
- 自動音声認識 (ASR):ヨーロッパ言語、日本語、北京語を含む複数の言語にわたるバッチおよびストリーミングの文字起こしをサポートします。
- テキスト読み上げ (TTS):SSMLを備えた並列合成と、音声クローン作成をサポートするストリーミングTTSを特徴としています。
- 話者分離:オーディオストリーム内の異なる話者を分離して識別するためのオンライン(リアルタイム)およびオフライン(バッチ)パイプラインを提供します。
- 音声アクティビティ検出 (VAD):Sileroモデルを使用して、音声が発生しているタイミングを検出します。
- Apple Neural Engine最適化:最大のパフォーマンスと最小の消費電力を確保するために、特にANEに合わせてチューニングされています。
- 逆テキスト正規化 (ITN):口語形式のテキスト(例:"two hundred")を書面形式(例:"200")に変換するツールが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト