FluidInference/FluidAudio

Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.

解決的問題

FluidAudio 是一個 Swift SDK,讓開發者能夠將高效能、完全本地的音訊 AI 功能整合到 Apple 裝置(macOS 和 iOS)中。它消除了對雲端音訊處理的需求,透過將推論卸載至 Apple Neural Engine (ANE) 來確保隱私並降低延遲。

運作方式

該 SDK 提供了一組優化的 CoreML 模型,直接在 ANE 上執行,避免使用 CPU 和 GPU,以將功耗和記憶體使用量降至最低。它整合了適用於各種音訊任務的開源模型,這些模型可以透過 Swift Package Manager 或 React Native 和 Rust/Tauri 的官方包裝器加入專案中。

適用對象

專為建構需要即時或批次音訊處理之應用程式的 Apple 平台開發者所設計,例如聽寫工具、會議助理和語音控制介面。

特色

  • 自動語音辨識 (ASR):支援多種語言的批次和串流轉錄,包括歐洲語言、日語和華語。
  • 文字轉語音 (TTS):具備包含 SSML 的並行合成與支援語音複製的串流 TTS 功能。
  • 說話者分離:提供線上(即時)和離線(批次)管線,以分離和識別音訊串流中的不同說話者。
  • 語音活動偵測 (VAD):使用 Silero 模型來偵測何時有語音發生。
  • Apple Neural Engine 優化:專門針對 ANE 進行調校,以確保最高效能和最低功耗。
  • 反向文字正規化 (ITN):包含將口語形式文字(例如 "two hundred")轉換為書面形式(例如 "200")的工具。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案