QwenAudio/Fun-ASR

Open-source LLM-based ASR model family for Chinese, dialect, accent, and multilingual speech, with FunASR, vLLM, streaming, and llama.cpp runtimes.

解決的問題

Fun-ASR 提供高精度、端對端的語音辨識(ASR),專為處理現實世界中的複雜音訊而設計。它特別解決了在強背景雜訊、遠場拾音(如會議室或車內)以及多樣的中文方言和地區口音複雜性下的語音轉錄難題。

工作原理

本專案提供一系列模型,其中最著名的是 800M 參數的 Nano 檢查點。這些模型在大型資料集上進行訓練——最多達數千萬小時的語音資料,以確保穩健性。該系統可透過以下方式部署:

  • PyTorch 原生: 適用於一般用途的標準推理。
  • vLLM 引擎: 高吞吐量路徑,批量處理速度提升 3-5 倍,並支援生產級 WebSocket 流式傳輸,實現即時字幕。
  • llama.cpp/GGUF: 自包含二進位版本,可在 CPU 或邊緣裝置上執行,無需 Python 執行環境。
  • 組合流程: 雖然 Nano 模型不原生支援說話人標籤或時間戳,但可與獨立模型(如 FSMN-VAD 用於語音活動檢測,CAM++ 用於說話人分離)結合,生成帶標籤的轉錄文字。

適用對象

本工具適用於需要在嘈雜環境中實現高精度語音辨識、支援廣泛東亞及東南亞語言,或能在資源受限的邊緣硬體上部署的開發者與工程師。

主要亮點

  • 廣泛的語言支援: 包含支援 31 種語言的多語言檢查點,以及專為中文、英文、日文和 7 種主要中文方言優化之專用 Nano 檢查點。
  • 抗噪能力強: 對遠場與高雜訊場景優化,識別準確率最高可達 93%。
  • 專業辨識能力: 即使在音樂背景干擾下,也能識別歌詞與說唱語音。
  • 高效率: 透過 vLLM 集成,批量轉錄速度相比 PyTorch 原生版本最高可提升 16 倍。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案