FluidInference/FluidAudio

Frontier CoreML audio models in your apps — text-to-speech, speech-to-text, voice activity detection, and speaker diarization. In Swift, powered by SOTA open source.

解决的问题

FluidAudio 是一个 Swift SDK,使开发者能够将高性能、完全本地的音频 AI 功能集成到 Apple 设备(macOS 和 iOS)中。它消除了对基于云端的音频处理的需求,通过将推理卸载至 Apple Neural Engine (ANE) 来确保隐私并降低延迟。

工作原理

该 SDK 提供了一组优化的 CoreML 模型,直接在 ANE 上运行,避免使用 CPU 和 GPU,以将功耗和内存使用降至最低。它集成了用于各种音频任务的开源模型,这些模型可以通过 Swift Package Manager 或 React Native 和 Rust/Tauri 的官方包装器添加到项目中。

适用对象

专为构建需要实时或批量音频处理应用的 Apple 平台开发者设计,例如听写工具、会议助手和语音控制界面。

亮点

  • 自动语音识别 (ASR):支持多种语言的批量和流式转录,包括欧洲语言、日语和普通话。
  • 文本转语音 (TTS):具备包含 SSML 的并行合成与支持语音克隆的流式 TTS 功能。
  • 说话人分离:提供在线(实时)和离线(批量)管道,以分离和识别音频流中的不同说话人。
  • 语音活动检测 (VAD):使用 Silero 模型来检测何时有语音发生。
  • Apple Neural Engine 优化:专门针对 ANE 进行调优,以确保最高性能和最低功耗。
  • 逆向文本标准化 (ITN):包含将口语形式文本(例如 "two hundred")转换为书面形式(例如 "200")的工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目