FluidInference/FluidAudio

Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.

它解决了什么问题

FluidAudio 是一个 Swift SDK,帮助开发者在 macOS 和 iOS 应用中集成高性能、完全本地的音频 AI 功能。它消除对云端音频处理的需求,确保用户隐私,并通过将推理卸载至 Apple Neural Engine (ANE) 来降低延迟。

它如何工作

SDK 提供一套针对各种音频任务优化的 CoreML 模型。通过直接在 ANE 上运行推理,最小化 CPU 和 GPU 的使用量,使其非常适合后台处理和常驻工作负载。它支持多种开源模型(MIT/Apache 2.0),并提供官方的 React Native、Expo 和 Rust/Tauri 包装器。

适用人群

该 SDK 面向 Apple 平台开发者,适用于需要转录、文本转语音或说话人识别且不依赖外部服务器的应用。

亮点

  • 自动语音识别 (ASR):支持批量和流式转录,涵盖多种语言,包括欧洲语言、日语和普通话中文。
  • 文本转语音 (TTS):包括支持 SSML 与发音控制的并行合成,以及支持流式 TTS 与语音克隆。
  • 说话人分割 (Speaker Diarization):提供在线(实时)和离线(批处理)两种管线,用于说话人分离和识别。
  • 语音活动检测 (VAD):集成 Silero 模型,实现高效的语音检测。
  • Apple Neural Engine 优化:专为 ANE 调校,以最大化性能并降低功耗。
  • 开源模型:使用来自 HuggingFace 的公开模型,经过设备端使用的优化。