Hugging Face 开放 ASR 排行榜:使用私有数据集对抗 Benchmaxxing
使用私有数据防止 Benchmaxxing
为了确保排行榜排名反映模型的真实鲁棒性,而不是针对特定公共数据集的优化,Hugging Face 将新高质量数据集保持为私有。此做法降低了测试集污染的风险,开发者可能会显式使用公共测试集进行训练,或寻找与之高度相似的数据以人为提升宏平均分数。
尽管开放 ASR 排行榜通过开源 UI 代码和评估脚本坚持开放性,私有数据集的引入实现了必要的平衡。通过使用模型开发者无法获取的数据,排行榜能够更准确地识别模型性能中的缺口和偏差,尤其是在对话语音和非美式口音等未被充分覆盖的场景中。
新评估数据集及覆盖范围
Appen Inc. 与 DataoceanAI 提供了涵盖多种口音、风格和转录类型的数据集。这些数据集已分类,以便进行针对性的性能分析:
| Dataset | 口音 | 时长 [h] | 男性 (%) / 女性 (%) | 风格 | 转录 |
|---|---|---|---|---|---|
| Appen Scripted AU | 澳大利亚 | 1.42 | 49 / 51 | 朗读 | 标点,大小写 |
| Appen Scripted CA | 加拿大 | 1.53 | 52 / 48 | 朗读 | 标点,大小写 |
| Appen Scripted IN | 印度 | 1.02 | 49 / 51 | 朗读 | 标点,大小写 |
| Appen Scripted US | 美国 | 1.45 | 49 / 51 | 朗读 | 标点,大小写 |
| Appen Conversational IN | 印度 | 1.37 | 51 / 49 | 对话式,随意 | 标点,口误 |
| Appen Conversational US003 | 美国 | 1.64 | 49 / 51 | 对话式,随意 | 标点,大小写,口误 |
| Appen Conversational US004 | 美国 | 1.65 | 49 / 51 | 对话式,随意 | 标点,口误 |
| DataoceanAI Scripted US | 美国 | 2.43 | 54 / 46 | 朗读 | 标点,大小写(专有名词),口误 |
| DataoceanAI Scripted GB | 英国 | 2.43 | 47 / 53 | 朗读 | 标点,口误 |
| DataoceanAI Conversational US | 美国 | 8.82 | NA | 对话式,随意 | 标点,口误 |
| DataoceanAI Conversational GB | 英国 | 5.96 | NA | 对话式,随意 | 标点,口误 |
目标指标与排行榜功能
排行榜现在新增了“Private data”(私有数据)标签页,提供特定的宏平均指标,以突出性能细节:
- Average WER:对各数据提供者的平均值进行宏平均,确保提供者之间权重相等。
- Avg Scripted:对所有朗读数据集进行宏平均。
- Avg Conversational:所有对话式数据集的 ASR 性能宏平均。
- Avg US:所有美国口音数据集的宏平均。
- Avg non-US:所有非美国口音数据集的宏平均。
为防止开发者针对特定口音或提供者进行优化,排行榜不提供各拆分的单独得分。默认情况下,排行榜上的平均词错误率(WER)仅基于公共数据集计算。用户可以手动开启“Private data”拆分,查看其对宏平均及模型排名(Rank Δ)的影响。
模型评估流程
模型开发者可通过以下步骤在私有数据上评估其模型:
- 在 Open ASR Leaderboard 的 GitHub 仓库提交 pull request。
- 通过模型检查清单报告公共数据集的结果。
- Hugging Face 验证公共结果并在私有数据集上计算指标。
- 开发者确认最终结果。
或者,开发者可以通过在模型卡中添加 YAML 文件自行报告公共集合的指标,这会将模型放置在数据集页面的未验证排行榜上。
标准化与鲁棒性
为保持有意义的基准,Hugging Face 使用基于 OpenAI Whisper 正规化器的归一化工具。该工具通过去除标点、大小写并映射为美式拼写,统一模型输出和数据集转录。所有测试集已合并为 Hub 上的单一数据集,便于访问和预览。