Hugging Face Open LLM Leaderboard 更新:整合 Math-Verify 以改進數學評估

Hugging Face 已將 Math-Verify 解析器整合到 Open LLM Leaderboard 中,以解決導致模型在數學任務上的表現被低估的系統性解析錯誤。此更新涉及對 3,751 個模型進行全面重新評估,導致 MATH-Hard 排行榜發生顯著變動。

先前數學評估存在缺陷的原因

Open LLM Leaderboard 的 MATH-Hard 任務根據 Hendrycks MATH 資料集中的 1,324 道高難度(第 5 級)問題,評估模型在代數、預微積分和數論七個主題上的表現。先前,評估流程依賴嚴格的答案格式和 SymPy 解析,導致正確答案因三個主要失誤點而被標記為錯誤:

1. 格式嚴格性

模型若未以完全相同的字串 "Final answer is [ANSWER]. I hope it is correct" 結束其回應,即使數學結果正確,也會被標記為錯誤。Math-Verify 移除了對嚴格格式的依賴。

2. 提取與解析失敗

先前的系統在從常見的 LaTeX 邊框或特定數學結構中提取答案時遇到困難。失敗的例子包括:

  • LaTeX Borders:oxed{} 符號包裹的答案(DeepSeek 模型常見)未被提取。
  • Complex Structures: 矩陣、區間(例如 (-oo, -14))和參數方程式常被錯誤解析或完全失敗。
  • Invalid Symbols: 簡單的百分號(例如 "100%")導致提取失敗。

3. 等價比較問題

即使成功提取,系統也缺乏判斷兩個在數學上等價的表達式是否相同的能力。它無法識別:

  • Numerical Equivalence: 例如,1/3 未被識別為等於 0.333333,原因是缺少四捨五入支援。
  • Symbolic Equivalence: 類似 sqrt(1/2)*7sqrt(0.5)*7 的表達式被標記為不同。
  • Advanced Types: 系統缺乏對矩陣等價和集合比較的支援(例如 {1} ∪ {1,4}{1,4})。

對模型表現和排名的影響

過渡到 Math-Verify 使所有模型的平均得分提升了 4.66 分,模型平均正確解決的問題數增加了 61 題。

特定學科的提升

最顯著的提升出現在與代數相關的子集:

  • Algebra: 8.27 分提升。
  • Prealgebra: 6.93 分提升。

這些提升歸因於 Math-Verify 對集合和矩陣的處理改進,這些在該學科中很常見。

模型家族變動

某些模型家族因其特定的輸出樣式先前被懲罰而出現顯著的得分提升:

  • DeepSeek: 得分幾乎增加了三倍,因為解析器現在正確處理 oxed{} 符號。
  • Qwen: 得到的得分超過翻倍,修正了先前對表現的嚴重低估。

排行榜重新排列

MATH-Hard 前 20 名排名已被完全改革。Nvidia 的 AceMath 模型現在主導排行榜,緊隨其後的是 Qwen 的衍生模型。儘管總體排行榜的前四名保持不變,但許多其他模型因數學得分提升而在總體排名中躍升了 200 名或更多。

結論

採用 Math-Verify 確保 Open LLM Leaderboard 能反映模型的實際數學能力,而非其遵循特定字串格式的能力。Hugging Face 鼓勵研究人員和開發者在自己的內部評估中使用 Math-Verify,以獲得更可靠的結果。

Sources