Open ASR Leaderboard 增加了用于印地语和印度英语的 Monsoon 数据集

Hugging Face 和 Voice Arena 通过引入用于印地语 (hi-IN) 和印度英语 (en-IN) 的 Monsoon 评估集,扩展了 Open ASR Leaderboard。此次更新为排行榜的多语言选项卡引入了首个全球南方语言,超越了总体的字错误率 (WER),以揭示 ASR 性能在不同地理位置、年龄、性别和设备类型之间的差异。

解决 ASR 评估中的人口统计学偏差

总体的 WER 往往会掩盖不同说话人群体之间显著的性能差异。研究表明,商业 ASR 系统在针对黑人说话人时的表现可能明显差于白人说话人,且在性别、年龄和口音方面也存在进一步的偏差。

为了解决这个问题,Monsoon 数据集提供了一个框架,其测试集在九个特定维度上进行变化,以揭示这些失效模式:

  • Geography (地理): 在数百个地区进行招募,而非仅限于少数几个地点。
  • Devices and Acoustic Environments (设备与声学环境): 使用贡献者自己的手机和真实的连接环境(室内和室外),而非录音室硬件。
  • Vocabulary, Speech Type, and Rate (词汇、语音类型与速率): 设计旨在引导表达观点、分歧、叙述和回忆的提示词,以捕捉未经排练的措辞和命名实体。
  • Demographics (人口统计学): 验证每位说话人的年龄和性别。
  • Reference Flexibility (参考文本灵活性): 支持为同一段音频提供多个有效的转录文本。

数据集构成与说话人多样性

Monsoon 系列由四个拆分集(两种语言的公开集和私有集)组成,这些数据源自未经剧本的、双通道的自发对话。

Set Language Duration Speakers Mean/Median Clip Length M/F Districts Devices Style
Monsoon en-IN public Indian English 5.62 h 1,444 9.6s / 10.4s 50/50 428 556 Conversational
Monsoon en-IN private Indian English 5.58 h 1,405 9.6s / 10.4s 45/55 420 560 Conversational
Monsoon hi-IN public Hindi 1.33 h 468 6.4s / 5.0s 315 202 315 Conversational
Monsoon hi-IN private Hindi 4.47 h 1,571 6.6s / 5.3s 55/45 295 582 Conversational

关键多样性指标

  • Low Speaker Concentration (低说话人集中度): 前 10 名说话人仅占总时长的 2.8% 至 6.8%,确保没有单一的声音主导评分。
  • Hardware Variance (硬件差异): 录音涵盖了 315 到 582 种不同的设备型号,防止对特定麦克风响应的过拟合。
  • Regional Representation (区域代表性): 印度英语集涵盖了印度的所有六个区域,其中 35% 的片段来自南部说话人,18% 来自东部,18% 来自中部,16% 来自北部,以及 11% 来自西部。

区域性能差异

包含详细的元数据(每个片段包含 12 个属性,包括职业、教育程度和原籍地区)使得能够对模型的失效进行细粒度的分析。

在对公开的印度英语拆分集进行的一次说明性测试中,八个模型显示出几乎相同的总体 WER (在 4.81 到 4.99 之间)。然而,当按区域拆分后,差异变得非常显著:mistralai/Voxtral-Mini-3B-2507 在不同区域间的差异为 1.68 个点,其在中部区域 (4.38) 的表现明显优于东部区域 (6.06)。这表明,在标准排行榜上看起来表现一致的模型,可能会根据说话人的来源地而具有截然不同的可靠性。

处理印地语的正字法变体

印地语面临着独特的挑战,因为许多拼写方式缺乏规范的映射,特别是对于语码混合的英语单词和复合形式。标准的 WER 会因为模型选择了与标注员的具体选择不同的有效正字法变体而对模型进行惩罚。

为了解决这个问题,印地语数据集使用了 lattice(格点)——即转录文本中每个片段的所有认可的正确拼写列表。Hugging Face 现在为印地语报告 Orthographically-Informed Word Error Rate (OIWER),它将格点中任何被认可的形式都视为正确。

将 WER 与 OIWER 进行比较可以发现,排名可能会发生翻转;一个系统可能仅仅因为其拼写拼写方式恰好与标注员的拼写偏好一致,而非因为其声学识别能力更强,而在单一参考文本下显得表现优于其他系统。

集成与评估流程

  • Indian English: 集成到主排行榜中,作为 Voice Arena Monsoon,并计入头条的平均 WER。
  • Hindi: 可在多语言选项卡中查看,并通过 "Language dataset breakdown" 下拉菜单进行查看。

若要针对私有拆分集进行评估,开发者必须通过 Open ASR Leaderboard GitHub 提交其模型,并在 Hugging Face 团队计算私有数据上的指标之前,通过公开集进行验证。

Sources

相关