Hugging Face Open LLM Leaderboard 更新:集成 Math-Verify 以改进数学评估
Hugging Face 将 Math-Verify 解析器集成到 Open LLM Leaderboard 中,以解决在数学任务中低估模型性能的系统性解析错误。此次更新涉及对 3,751 个模型的全面重新评估,导致 MATH-Hard 排行榜排名发生显著变化。
之前的数学评估为何存在缺陷
Open LLM Leaderboard 的 MATH-Hard 任务评估模型在 Hendrycks MATH 数据集中的 1,324 道高难度(Level 5)问题上,涵盖七个主题,包括代数、预微积分和数论。之前,评估管道依赖于严格的答案格式和 SymPy 解析,导致正确答案被标记为错误,原因有三个主要失效点:
1. 格式严格性
未能以确切字符串 "Final answer is [ANSWER]. I hope it is correct" 结尾其响应的模型会被标记为错误,即使其数学结果正确。Math-Verify 消除了对这种刚性格式的依赖。
2. 提取和解析失败
之前的系统在从常见的 LaTeX 边界或特定数学结构中提取答案时遇到困难。失败的例子包括:
- LaTeX 边界: 用
oxed{}表示法包裹的答案(DeepSeek 模型常见)未被提取。 - 复杂结构: 矩阵、区间(例如
(-oo, -14))和参数方程经常被错误解析或完全失败。 - 无效符号: 简单的百分号(例如 "100%")导致提取失败。
3. 等价比较问题
即使提取成功,系统也缺乏判断两个在数学上等价的表达式是否相同的能力。它未能识别:
- 数值等价: 例如,
1/3未被识别为等于0.333333,这是因为缺少四舍五入支持。 - 符号等价: 类似
sqrt(1/2)*7和sqrt(0.5)*7的表达式被标记为不同。 - 高级类型: 系统缺乏对矩阵等价和集合比较的支持(例如
{1} ∪ {1,4}与{1,4})。
对模型性能和排名的影响
过渡到 Math-Verify 使得所有模型的平均得分提高了 4.66 分,模型平均正确解决的问题数量增加了 61 个。
特定学科的提升
最显著的提升出现在与代数相关的子集中:
- 代数: 得分提升 8.27 分。
- 预代数: 得分提升 6.93 分。
这些提升归功于 Math-Verify 对集合和矩阵处理的改进,这些在这些学科中很常见。
模型家族的变化
某些模型家族由于其特定的输出风格之前被惩罚,因而出现了显著的得分提升:
- DeepSeek: 得分几乎翻了三倍,因为解析器现在能正确处理
oxed{}表示法。 - Qwen: 得分超过翻了一倍,纠正了之前对性能的严重低估。
排行榜重新洗牌
MATH-Hard Top 20 排名已经彻底改革。Nvidia 的 AceMath 模型现在主导排行榜,紧随其后的是 Qwen 的衍生模型。虽然综合排行榜的前四名保持不变,但许多其他模型因数学得分提升而在总体排名中跃升了 200 多个位置。
结论
采用 Math-Verify 确保 Open LLM Leaderboard 能够反映模型的实际数学能力,而不仅仅是其遵循特定字符串格式的能力。Hugging Face 鼓励研究人员和开发者在自己的内部评估中使用 Math-Verify,以获得更可靠的结果。