xzf-thu/Mega-ASR

First foundation ASR built for the real world - 7 atomic acoustic conditions, 54 compound scenarios, 2.6M samples, and up to ~30% gains over SOTA where every other model falls apart. **You'll come back to MEGA-ASR, after the rest fail in the wild. ⭐**

解決的問題

Mega-ASR 解決了標準自動語音辨識(ASR)模型在真實複雜環境中的失效問題。大多數模型在面對背景雜訊、回音或電子失真等現實世界音效挑戰時,往往導致高詞錯誤率(WER)或完全空的輸出。

工作原理

該項目透過擴大真實世界聲學模擬,建構了一個穩健的基礎模型。它在包含7種基本聲學條件和54種複合場景的240萬樣本上進行訓練,包括:

  • 雜訊和遠場語音
  • 障礙物和混響
  • 录音偽影和電子失真
  • 傳輸中斷

為優化性能,採用了 A2S-SFT(監督微調)和 基於 DG-WGPO 的 RL(強化學習)。

適用對象

專為需要在傳統SOTA模型通常失效的挑戰性非錄音室聲學環境中實現高精度語音轉文字的開發者和研究人員設計。

主要亮點

  • 穩健性:專門針對全場景穩健語音辨識。
  • 規模:在涵蓋多種真實世界條件的240萬樣本資料集上進行訓練。
  • 性能:在困難環境中,性能相比領先的開源和閉源SOTA模型最高提升近30%。
  • 全面模擬:涵蓋從傳輸中斷到遠場語音的廣泛聲學失真。

相關

  • 專案
  • 專案
  • 專案
  • 專案