xzf-thu/Mega-ASR

First foundation ASR built for the real world - 7 atomic acoustic conditions, 54 compound scenarios, 2.6M samples, and up to ~30% gains over SOTA where every other model falls apart. **You'll come back to MEGA-ASR, after the rest fail in the wild. ⭐**

解决的问题

Mega-ASR 解决了标准自动语音识别(ASR)模型在真实复杂环境中的失效问题。大多数模型在面对背景噪声、回声或电子失真等现实世界音效挑战时,往往导致高词错误率(WER)或完全空的输出。

工作原理

该项目通过扩大真实世界声学模拟,构建了一个稳健的基础模型。它在包含7种基本声学条件和54种复合场景的240万样本上进行了训练,包括:

  • 噪声和远场语音
  • 障碍物和混响
  • 录音伪影和电子失真
  • 传输中断

为优化性能,采用了 A2S-SFT(监督微调)和 基于 DG-WGPO 的 RL(强化学习)。

适用人群

专为需要在传统SOTA模型通常失效的挑战性非录音室声学环境中实现高精度语音转文本的开发者和研究人员设计。

主要亮点

  • 鲁棒性:专门针对全场景鲁棒语音识别。
  • 规模:在涵盖多种真实世界条件的240万样本数据集上进行训练。
  • 性能:在困难环境中,性能相比领先的开源和闭源SOTA模型最高提升近30%。
  • 全面模拟:覆盖从传输中断到远场语音的广泛声学失真。

相关

  • 项目
  • 项目
  • 项目
  • 项目