FluidInference/FluidAudio

Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.

What it solves

FluidAudio 是一个 Swift SDK,可在 Apple 设备上實現完全本地化、低延遲的音訊 AI。它透過將推論過程卸載到 Apple Neural Engine (ANE) 來解決依賴雲端音訊處理的問題,這在保持使用者隱私的同時,減少了記憶體使用量、降低了功耗並提升了速度。

How it works

該 SDK 整合了直接在 ANE 上運行的優化開源模型 (MIT/Apache 2.0),完全避免了使用 CPU 和 GPU/MPS。它為多種音訊任務提供了一個統一的介面:

  • Automatic Speech Recognition (ASR):使用 Parakeet TDT 和 SenseVoice 等模型,支援多種語言的批次與串流轉錄。
  • Text-to-Speech (TTS):透過 Kokoro 和 PocketTTS 實現並行合成與串流 TTS 以及語音複製。
  • Speaker Diarization:提供線上與離線管線,用於區分並識別音訊串流中的不同說話者。
  • Voice Activity Detection (VAD):使用 Silero 模型來偵測語音何時發生。

Who it’s for

它專為 macOS 和 iOS 開發者設計,旨在構建隱私優先、離線運行的音訊應用程式,例如會議助手、聽寫工具和語音控制介面。

Highlights

  • Apple Neural Engine Optimization:透過在 ANE 上進行推論,實現最大效能與最低功耗。
  • Comprehensive Audio Suite:在一個 SDK 中包含 ASR、TTS、說話者分割 (speaker diarization)、以及 VAD。
  • Multilingual Support:支援轉錄與合成數十種語言,包括英語、歐洲語言、日語和中文普通話。
  • Local-First Architecture:完全離線處理確保了數據隱私並消除了雲端延遲。
  • Extensible Integration:提供 Swift package,並附帶 React Native/Expo 和 Rust/Tauri 的官方封裝。