QwenAudio/Fun-ASR

Open-source LLM-based ASR model family for Chinese, dialect, accent, and multilingual speech, with FunASR, vLLM, streaming, and llama.cpp runtimes.

解决的问题

Fun-ASR 提供高精度、端到端的语音识别(ASR),专为处理现实世界中的复杂音频而设计。它特别解决了在强背景噪声、远场拾音(如会议室或车内)以及多种中国方言和地域口音复杂性下的语音转录难题。

工作原理

该项目提供一系列模型,其中最著名的是 800M 参数的 Nano 检查点。这些模型在大规模数据集上进行训练——最多达数千万小时的语音数据,以确保鲁棒性。该系统可通过以下方式部署:

  • PyTorch 原生: 适用于一般用途的标准推理。
  • vLLM 引擎: 高吞吐量路径,批量处理速度提升 3-5 倍,并支持生产级 WebSocket 流式传输,实现实时字幕。
  • llama.cpp/GGUF: 自包含二进制版本,可在 CPU 或边缘设备上运行,无需 Python 运行时环境。
  • 组合流水线: 虽然 Nano 模型不原生支持说话人标签或时间戳,但可与独立模型(如 FSMN-VAD 用于语音活动检测,CAM++ 用于说话人分离)结合,生成带标签的转录文本。

适用人群

本工具适用于需要在嘈杂环境中实现高精度语音识别、支持广泛东亚及东南亚语言,或能够在资源受限的边缘硬件上部署的开发者和工程师。

主要亮点

  • 广泛的语言支持: 包含支持 31 种语言的多语言检查点,以及专为中文、英文、日文和 7 种主要中文方言优化的专用 Nano 检查点。
  • 抗噪能力强: 针对远场和高噪声场景优化,识别准确率最高可达 93%。
  • 专业识别能力: 即使在音乐背景干扰下,也能识别歌词和说唱语音。
  • 高性能: 通过 vLLM 集成,批量转录速度相比 PyTorch 原生版本最高可提升 16 倍。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目