FluidInference/FluidAudio

Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.

解決する課題

FluidAudioは、開発者が高性能かつ完全にローカルなオーディオAI機能をAppleデバイス(macOSおよびiOS)に統合できるようにするSwift SDKです。クラウドベースのオーディオ処理の必要性を排除し、推論をApple Neural Engine (ANE) にオフロードすることでプライバシーを確保し、レイテンシを削減します。

仕組み

このSDKは、ANE上で直接実行される最適化されたCoreMLモデルのセットを提供し、CPUとGPUを回避することで消費電力とメモリ使用量を最小限に抑えます。Swift Package ManagerまたはReact NativeおよびRust/Tauriの公式ラッパーを介してプロジェクトに追加できる、さまざまなオーディオタスク用のオープンソースモデルを統合しています。

対象者

リアルタイムまたはバッチのオーディオ処理を必要とするアプリを構築するAppleプラットフォーム開発者(ディテーションツール、会議アシスタント、音声制御インターフェースなど)向けに設計されています。

ハイライト

  • 自動音声認識 (ASR):ヨーロッパ言語、日本語、北京語を含む複数の言語にわたるバッチおよびストリーミングの文字起こしをサポートします。
  • テキスト読み上げ (TTS):SSMLを備えた並列合成と、音声クローン作成をサポートするストリーミングTTSを特徴としています。
  • 話者分離:オーディオストリーム内の異なる話者を分離して識別するためのオンライン(リアルタイム)およびオフライン(バッチ)パイプラインを提供します。
  • 音声アクティビティ検出 (VAD):Sileroモデルを使用して、音声が発生しているタイミングを検出します。
  • Apple Neural Engine最適化:最大のパフォーマンスと最小の消費電力を確保するために、特にANEに合わせてチューニングされています。
  • 逆テキスト正規化 (ITN):口語形式のテキスト(例:"two hundred")を書面形式(例:"200")に変換するツールが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト