FireRedTeam/FireRedASR2S

A SOTA Industrial-Grade All-in-One ASR system with ASR, VAD, LID, and Punc modules. FireRedASR2 supports Chinese (Mandarin, 20+ dialects/accents), English, code-switching, and both speech and singing ASR. FireRedVAD supports speech/singing/music in 100+ langs. FireRedLID supports 100+ langs and 20+ zh dialects. FireRedPunc supports zh and en.

它解決的問題

FireRedASR2S 是一個工業級的全功能自動語音辨識(ASR)系統,專為處理複雜的音訊轉錄任務而設計。它解決了對統一工作流程的需求,該流程能夠偵測語音活動、識別 spoken languages(包括多種中文方言)、轉錄語音與歌唱內容,並自動為結果文字加上標點符號。

如何運作

該系統整合了四個專用模組,可作為完整流程一起使用,也可獨立運作:

  • FireRedASR2:核心轉錄引擎。提供兩種版本:一種為 LLM 基於 的版本,可達最佳性能與端到端互動;另一種為 AED(基於注意力的編碼器-解碼器) 版本,能在性能與運算效率之間取得平衡。
  • FireRedVAD:語音活動偵測模組,可識別 100 多種語言中的語音、歌唱或音樂。支援串流與非串流模式。
  • FireRedLID:語音語言辨識模組,可識別 100 多種語言及超過 20 種中文方言/口音。
  • FireRedPunc:標點符號預測模組,可為中文與英文轉錄內容自動添加適當的標點。

適用對象

此系統適用於開發人員與工程師,用於建構工業級的語音轉文字應用,特別是那些需要高準確度處理國語、各種中文方言、英文,以及混合語言情境的場景。

主要特色

  • 全面的方言支援:對國語及 20 多種中文方言/口音(例如粵語、四川話、上海話)具有高準確度。
  • 全功能整合流程:將 VAD、LID、ASR 與標點預測整合於單一系統中。
  • 彈性架構設計:提供 LLM 與 AED 模型版本,讓使用者可在最高準確度與更高效率之間自由選擇。
  • 高性能量產:在 CER 與 F1 分數上超越多項產業基準(如 Whisper 與 Fun-ASR)。
  • 推論加速支援:支援 TensorRT-LLM,可實現顯著加速(最高達 12.7 倍),並整合 vLLM 以實現高效能服務。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案