FluidInference/FluidAudio
Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.
解決的問題
FluidAudio 是一個 Swift SDK,讓開發者能夠將高效能、完全本地的音訊 AI 功能整合到 Apple 裝置(macOS 和 iOS)中。它消除了對雲端音訊處理的需求,透過將推論卸載至 Apple Neural Engine (ANE) 來確保隱私並降低延遲。
運作方式
該 SDK 提供了一組優化的 CoreML 模型,直接在 ANE 上執行,避免使用 CPU 和 GPU,以將功耗和記憶體使用量降至最低。它整合了適用於各種音訊任務的開源模型,這些模型可以透過 Swift Package Manager 或 React Native 和 Rust/Tauri 的官方包裝器加入專案中。
適用對象
專為建構需要即時或批次音訊處理之應用程式的 Apple 平台開發者所設計,例如聽寫工具、會議助理和語音控制介面。
特色
- 自動語音辨識 (ASR):支援多種語言的批次和串流轉錄,包括歐洲語言、日語和華語。
- 文字轉語音 (TTS):具備包含 SSML 的並行合成與支援語音複製的串流 TTS 功能。
- 說話者分離:提供線上(即時)和離線(批次)管線,以分離和識別音訊串流中的不同說話者。
- 語音活動偵測 (VAD):使用 Silero 模型來偵測何時有語音發生。
- Apple Neural Engine 優化:專門針對 ANE 進行調校,以確保最高效能和最低功耗。
- 反向文字正規化 (ITN):包含將口語形式文字(例如 "two hundred")轉換為書面形式(例如 "200")的工具。
相關
- 專案
- 專案
- 專案
- 專案
- 專案