modelscope/FunASR

Open-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.

解決的問題

FunASR 是一個為離線、串流與邊緣部署設計的工業級語音辨識工具包,旨在提供高效率的端對端自動語音辨識(ASR)。它解決了使用者需要靈活組合專用模型進行轉錄、語音活動偵測(VAD)、標點補全與說話人分離的需求,而非依賴單一的龐大模型。

工作原理

該工具包使用 AutoModel 流水線協調多個專用模型。例如,典型的生產流程會結合轉錄模型(如 Paraformer 或 Fun-ASR-Nano)與 VAD 模型(fsmn-vad)和說話人識別模型(cam++)。它支援多種部署目標,包括透過 vLLM 實現 GPU 加速、OpenAI 相容 API 伺服器,以及基於 llama.cpp 的 C++ 執行環境,用於使用 GGUF 格式的高效率 CPU 與邊緣部署。

適用對象

適用於開發語音驅動應用程式、AI 代理與工業語音服務的開發者與工程師,這些應用需要低延遲、高準確度(特別是中文、英文與日文),並能在從高階 GPU 到邊緣裝置的多種硬體上部署。

主要特色

  • 高效率:使用 Fun-ASR-Nano 與 vLLM,最高可達 340 倍實時速度。
  • 豐富的模型庫:包含 ASR、情感辨識、音訊事件、說話人分離等專用模型。
  • 多平台部署:支援 Python、Docker 與基於 llama.cpp 的獨立 C++ 二進位檔,適用於 Windows、Linux 與 macOS。
  • 廣泛的語言支援:提供 31 種以上語言的檢查點,尤其在中文方言與地區口音方面具備優勢。
  • 支援 AI 代理:提供 Claude/Cursor 用的 MCP 伺服器,以及 LangChain 與 Dify 用的 OpenAI 相容端點。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案