QwenAudio/Fun-ASR
Open-source LLM-based ASR model family for Chinese, dialect, accent, and multilingual speech, with FunASR, vLLM, streaming, and llama.cpp runtimes.
解決的問題
Fun-ASR 提供高精度、端對端的語音辨識(ASR),專為處理現實世界中的複雜音訊而設計。它特別解決了在強背景雜訊、遠場拾音(如會議室或車內)以及多樣的中文方言和地區口音複雜性下的語音轉錄難題。
工作原理
本專案提供一系列模型,其中最著名的是 800M 參數的 Nano 檢查點。這些模型在大型資料集上進行訓練——最多達數千萬小時的語音資料,以確保穩健性。該系統可透過以下方式部署:
- PyTorch 原生: 適用於一般用途的標準推理。
- vLLM 引擎: 高吞吐量路徑,批量處理速度提升 3-5 倍,並支援生產級 WebSocket 流式傳輸,實現即時字幕。
- llama.cpp/GGUF: 自包含二進位版本,可在 CPU 或邊緣裝置上執行,無需 Python 執行環境。
- 組合流程: 雖然 Nano 模型不原生支援說話人標籤或時間戳,但可與獨立模型(如 FSMN-VAD 用於語音活動檢測,CAM++ 用於說話人分離)結合,生成帶標籤的轉錄文字。
適用對象
本工具適用於需要在嘈雜環境中實現高精度語音辨識、支援廣泛東亞及東南亞語言,或能在資源受限的邊緣硬體上部署的開發者與工程師。
主要亮點
- 廣泛的語言支援: 包含支援 31 種語言的多語言檢查點,以及專為中文、英文、日文和 7 種主要中文方言優化之專用 Nano 檢查點。
- 抗噪能力強: 對遠場與高雜訊場景優化,識別準確率最高可達 93%。
- 專業辨識能力: 即使在音樂背景干擾下,也能識別歌詞與說唱語音。
- 高效率: 透過 vLLM 集成,批量轉錄速度相比 PyTorch 原生版本最高可提升 16 倍。
相關
- 專案
- 專案
- 專案
- 專案
- 專案