FireRedTeam/FireRedASR2S
A SOTA Industrial-Grade All-in-One ASR system with ASR, VAD, LID, and Punc modules. FireRedASR2 supports Chinese (Mandarin, 20+ dialects/accents), English, code-switching, and both speech and singing ASR. FireRedVAD supports speech/singing/music in 100+ langs. FireRedLID supports 100+ langs and 20+ zh dialects. FireRedPunc supports zh and en.
它解決的問題
FireRedASR2S 是一個工業級的全功能自動語音辨識(ASR)系統,專為處理複雜的音訊轉錄任務而設計。它解決了對統一工作流程的需求,該流程能夠偵測語音活動、識別 spoken languages(包括多種中文方言)、轉錄語音與歌唱內容,並自動為結果文字加上標點符號。
如何運作
該系統整合了四個專用模組,可作為完整流程一起使用,也可獨立運作:
- FireRedASR2:核心轉錄引擎。提供兩種版本:一種為 LLM 基於 的版本,可達最佳性能與端到端互動;另一種為 AED(基於注意力的編碼器-解碼器) 版本,能在性能與運算效率之間取得平衡。
- FireRedVAD:語音活動偵測模組,可識別 100 多種語言中的語音、歌唱或音樂。支援串流與非串流模式。
- FireRedLID:語音語言辨識模組,可識別 100 多種語言及超過 20 種中文方言/口音。
- FireRedPunc:標點符號預測模組,可為中文與英文轉錄內容自動添加適當的標點。
適用對象
此系統適用於開發人員與工程師,用於建構工業級的語音轉文字應用,特別是那些需要高準確度處理國語、各種中文方言、英文,以及混合語言情境的場景。
主要特色
- 全面的方言支援:對國語及 20 多種中文方言/口音(例如粵語、四川話、上海話)具有高準確度。
- 全功能整合流程:將 VAD、LID、ASR 與標點預測整合於單一系統中。
- 彈性架構設計:提供 LLM 與 AED 模型版本,讓使用者可在最高準確度與更高效率之間自由選擇。
- 高性能量產:在 CER 與 F1 分數上超越多項產業基準(如 Whisper 與 Fun-ASR)。
- 推論加速支援:支援 TensorRT-LLM,可實現顯著加速(最高達 12.7 倍),並整合 vLLM 以實現高效能服務。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案