xzf-thu/Mega-ASR

First foundation ASR built for the real world - 7 atomic acoustic conditions, 54 compound scenarios, 2.6M samples, and up to ~30% gains over SOTA where every other model falls apart. **You'll come back to MEGA-ASR, after the rest fail in the wild. ⭐**

何を解決するか

Mega-ASRは、『野生の』環境における標準的な自動音声認識(ASR)モデルの失敗を解決します。ほとんどのモデルは、背景ノイズ、エコー、電子的歪みなどの現実世界の音響課題に直面すると、高い単語誤り率(WER)や完全に空の出力につながる場合が多くあります。

どう動くか

このプロジェクトは、現実世界の音響シミュレーションを拡大して、堅牢な基盤モデルを構築します。7つの原子的な音響状態と54の複合シナリオをカバーする240万サンプルで訓練されています。含まれる内容は以下の通りです:

  • ノイズと遠方からの音声
  • 障害物と残響
  • 記録アーティファクトと電子的歪み
  • 伝送の途切れ

パフォーマンス最適化のため、A2S-SFT(教師あり微調整)とDG-WGPOベースのRL(強化学習)を採用しています。

対象ユーザー

伝統的なSOTAモデルが通常失敗する、非スタジオ環境における高精度な音声認識が必要な開発者や研究者向けに設計されています。

主な特徴

  • 堅牢性:フルシナリオの堅牢な音声認識を特にターゲットにしています。
  • スケーラビリティ:多様な現実世界の状況をシミュレートする240万サンプルの巨大データセットで訓練されています。
  • パフォーマンス:困難な環境において、先進的なオープンソースおよびクローズドソースSOTAモデルと比較して、最大でほぼ30%の向上を達成しています。
  • 包括的なシミュレーション:遠方からの音声から伝送の途切れまで、幅広い音響歪みをカバーしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト