Hugging Face 开放 ASR 排行榜:使用私有数据集对抗 Benchmaxxing

使用私有数据防止 Benchmaxxing

为了确保排行榜排名反映模型的真实鲁棒性,而不是针对特定公共数据集的优化,Hugging Face 将新高质量数据集保持为私有。此做法降低了测试集污染的风险,开发者可能会显式使用公共测试集进行训练,或寻找与之高度相似的数据以人为提升宏平均分数。

尽管开放 ASR 排行榜通过开源 UI 代码和评估脚本坚持开放性,私有数据集的引入实现了必要的平衡。通过使用模型开发者无法获取的数据,排行榜能够更准确地识别模型性能中的缺口和偏差,尤其是在对话语音和非美式口音等未被充分覆盖的场景中。

新评估数据集及覆盖范围

Appen Inc. 与 DataoceanAI 提供了涵盖多种口音、风格和转录类型的数据集。这些数据集已分类,以便进行针对性的性能分析:

Dataset 口音 时长 [h] 男性 (%) / 女性 (%) 风格 转录
Appen Scripted AU 澳大利亚 1.42 49 / 51 朗读 标点,大小写
Appen Scripted CA 加拿大 1.53 52 / 48 朗读 标点,大小写
Appen Scripted IN 印度 1.02 49 / 51 朗读 标点,大小写
Appen Scripted US 美国 1.45 49 / 51 朗读 标点,大小写
Appen Conversational IN 印度 1.37 51 / 49 对话式,随意 标点,口误
Appen Conversational US003 美国 1.64 49 / 51 对话式,随意 标点,大小写,口误
Appen Conversational US004 美国 1.65 49 / 51 对话式,随意 标点,口误
DataoceanAI Scripted US 美国 2.43 54 / 46 朗读 标点,大小写(专有名词),口误
DataoceanAI Scripted GB 英国 2.43 47 / 53 朗读 标点,口误
DataoceanAI Conversational US 美国 8.82 NA 对话式,随意 标点,口误
DataoceanAI Conversational GB 英国 5.96 NA 对话式,随意 标点,口误

目标指标与排行榜功能

排行榜现在新增了“Private data”(私有数据)标签页,提供特定的宏平均指标,以突出性能细节:

  • Average WER:对各数据提供者的平均值进行宏平均,确保提供者之间权重相等。
  • Avg Scripted:对所有朗读数据集进行宏平均。
  • Avg Conversational:所有对话式数据集的 ASR 性能宏平均。
  • Avg US:所有美国口音数据集的宏平均。
  • Avg non-US:所有非美国口音数据集的宏平均。

为防止开发者针对特定口音或提供者进行优化,排行榜不提供各拆分的单独得分。默认情况下,排行榜上的平均词错误率(WER)仅基于公共数据集计算。用户可以手动开启“Private data”拆分,查看其对宏平均及模型排名(Rank Δ)的影响。

模型评估流程

模型开发者可通过以下步骤在私有数据上评估其模型:

  1. 在 Open ASR Leaderboard 的 GitHub 仓库提交 pull request。
  2. 通过模型检查清单报告公共数据集的结果。
  3. Hugging Face 验证公共结果并在私有数据集上计算指标。
  4. 开发者确认最终结果。

或者,开发者可以通过在模型卡中添加 YAML 文件自行报告公共集合的指标,这会将模型放置在数据集页面的未验证排行榜上。

标准化与鲁棒性

为保持有意义的基准,Hugging Face 使用基于 OpenAI Whisper 正规化器的归一化工具。该工具通过去除标点、大小写并映射为美式拼写,统一模型输出和数据集转录。所有测试集已合并为 Hub 上的单一数据集,便于访问和预览。

Sources