Hugging Face Open LLM Leaderboard 更新:集成 Math-Verify 以改进数学评估

Hugging Face 将 Math-Verify 解析器集成到 Open LLM Leaderboard 中,以解决在数学任务中低估模型性能的系统性解析错误。此次更新涉及对 3,751 个模型的全面重新评估,导致 MATH-Hard 排行榜排名发生显著变化。

之前的数学评估为何存在缺陷

Open LLM Leaderboard 的 MATH-Hard 任务评估模型在 Hendrycks MATH 数据集中的 1,324 道高难度(Level 5)问题上,涵盖七个主题,包括代数、预微积分和数论。之前,评估管道依赖于严格的答案格式和 SymPy 解析,导致正确答案被标记为错误,原因有三个主要失效点:

1. 格式严格性

未能以确切字符串 "Final answer is [ANSWER]. I hope it is correct" 结尾其响应的模型会被标记为错误,即使其数学结果正确。Math-Verify 消除了对这种刚性格式的依赖。

2. 提取和解析失败

之前的系统在从常见的 LaTeX 边界或特定数学结构中提取答案时遇到困难。失败的例子包括:

  • LaTeX 边界:oxed{} 表示法包裹的答案(DeepSeek 模型常见)未被提取。
  • 复杂结构: 矩阵、区间(例如 (-oo, -14))和参数方程经常被错误解析或完全失败。
  • 无效符号: 简单的百分号(例如 "100%")导致提取失败。

3. 等价比较问题

即使提取成功,系统也缺乏判断两个在数学上等价的表达式是否相同的能力。它未能识别:

  • 数值等价: 例如,1/3 未被识别为等于 0.333333,这是因为缺少四舍五入支持。
  • 符号等价: 类似 sqrt(1/2)*7sqrt(0.5)*7 的表达式被标记为不同。
  • 高级类型: 系统缺乏对矩阵等价和集合比较的支持(例如 {1} ∪ {1,4}{1,4})。

对模型性能和排名的影响

过渡到 Math-Verify 使得所有模型的平均得分提高了 4.66 分,模型平均正确解决的问题数量增加了 61 个。

特定学科的提升

最显著的提升出现在与代数相关的子集中:

  • 代数: 得分提升 8.27 分。
  • 预代数: 得分提升 6.93 分。

这些提升归功于 Math-Verify 对集合和矩阵处理的改进,这些在这些学科中很常见。

模型家族的变化

某些模型家族由于其特定的输出风格之前被惩罚,因而出现了显著的得分提升:

  • DeepSeek: 得分几乎翻了三倍,因为解析器现在能正确处理 oxed{} 表示法。
  • Qwen: 得分超过翻了一倍,纠正了之前对性能的严重低估。

排行榜重新洗牌

MATH-Hard Top 20 排名已经彻底改革。Nvidia 的 AceMath 模型现在主导排行榜,紧随其后的是 Qwen 的衍生模型。虽然综合排行榜的前四名保持不变,但许多其他模型因数学得分提升而在总体排名中跃升了 200 多个位置。

结论

采用 Math-Verify 确保 Open LLM Leaderboard 能够反映模型的实际数学能力,而不仅仅是其遵循特定字符串格式的能力。Hugging Face 鼓励研究人员和开发者在自己的内部评估中使用 Math-Verify,以获得更可靠的结果。

Sources