modelscope/FunASR

Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.

解决的问题

FunASR 是一个为离线、流式和边缘部署设计的工业级语音识别工具包,旨在提供高性能的端到端自动语音识别(ASR)。它解决了用户需要灵活组合专用模型进行转录、语音活动检测(VAD)、标点符号补全和说话人分离的需求,而不是依赖单一的庞大模型。

工作原理

该工具包使用 AutoModel 流水线协调多个专用模型。例如,典型的生产流水线会结合一个转录模型(如 Paraformer 或 Fun-ASR-Nano)与一个 VAD 模型(fsmn-vad)和一个说话人识别模型(cam++)。它支持多种部署目标,包括通过 vLLM 实现 GPU 加速、OpenAI 兼容 API 服务器,以及基于 llama.cpp 的 C++ 运行时,用于使用 GGUF 格式的高效率 CPU 和边缘部署。

适用人群

适用于开发语音驱动的应用程序、AI 代理和工业语音服务的开发者和工程师,这些应用需要低延迟、高精度(尤其是中文、英文和日文),并且能够在从高端 GPU 到边缘设备的多种硬件上部署。

主要亮点

  • 高性能:使用 Fun-ASR-Nano 和 vLLM,最高可实现 340 倍实时速度。
  • 丰富的模型库:包含 ASR、情感识别、音频事件、说话人分离等专用模型。
  • 多平台部署:支持 Python、Docker 和基于 llama.cpp 的独立 C++ 二进制文件,适用于 Windows、Linux 和 macOS。
  • 广泛的语言支持:提供 31 种以上语言的检查点,尤其在中文方言和地方口音方面具有优势。
  • 支持 AI 代理:提供 Claude/Cursor 用的 MCP 服务器,以及 LangChain 和 Dify 用的 OpenAI 兼容端点。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目