Hugging Face Open LLM Leaderboard Update: Integrating Math-Verify for Improved Math Evaluation
Hugging Face は、Open LLM リーダーボードに Math-Verify パーサーを統合し、数学的タスクにおけるモデルのパフォーマンスを過小評価していたシステム的な解析エラーを解決しました。このアップデートでは、3,751 モデルの包括的な再評価が行われ、MATH-Hard リーダーボードのランキングに大きな変化が生じました。
以前の数学評価が間違っていた理由
Open LLM リーダーボードの MATH-Hard タスクは、Hendrycks MATH データセットから代数、予備微積分、数論などの 7 つのトピックにわたる 1,324 問の高難易度(レベル 5)問題でモデルを評価します。以前、評価パイプラインは厳密な回答形式と SymPy パースに依存しており、これが 3 つの主要な失敗ポイントにより正解が不正解としてマークされる原因となっていました:
1. フォーマットの厳格さ
回答の末尾に正確な文字列 "Final answer is [ANSWER]. I hope it is correct" で終わらないモデルは、数学的結果が正しくても間違いとマークされました。Math-Verify はこの厳格なフォーマットへの依存を取り除きます。
2. 抽出とパースの失敗
以前のシステムは、一般的な LaTeX の枠線や特定の数学的構造から回答を抽出することに苦労していました。失敗の例には次のものがありました:
- LaTeX Borders:
oxed{}表記で囲まれた回答(DeepSeek モデルで一般的)は抽出されませんでした。 - Complex Structures: 行列、区間(例:
(-oo, -14))、およびパラメトリック方程式は、しばしば誤ってパースされたり完全に失敗したりしました。 - Invalid Symbols: シンプルなパーセント記号(例: "100%
3. 等価比較の問題
抽出された後でも、システムは二つの数学的に等価な式が同じかどうかを判断する能力がありませんでした。次の点を認識できませんでした:
- Numerical Equivalence: 例えば、
1/3が0.333333と等しいと認識されませんでした。これは丸めサポートの欠如によるものです。 - Symbolic Equivalence:
sqrt(1/2)*7とsqrt(0.5)*7のような式は異なるとマークされました。 - Advanced Types: システムは行列の等価性や集合の比較(例:
{1} ∪ {1,4}と{1,4})をサポートしていませんでした。
モデルのパフォーマンスとランキングへの影響
Math-Verify への移行により、すべてのモデルで平均スコアが 4.66 点上昇し、モデルは平均して 61 問多く正解するようになりました。
科目別の向上
最も顕著な改善は代数関連のサブセットで見られました:
- Algebra: 8.27 点の増加。
- Prealgebra: 6.93 点の増加。
これらの向上は、これらの科目で頻繁に現れる集合と行列の扱いが Math-Verify で改善されたことに起因します。
モデルファミリーの変化
特定のモデルファミリーは、以前は罰則の対象だった特定の出力スタイルのため、スコアが劇的に上昇しました:
- DeepSeek: パーサーが今では
oxed{}表記を正しく処理するため、スコアはほぼ3倍になりました。 - Qwen: スコアは2倍以上になり、以前のパフォーマンスの深刻な過小評価が修正されました。
リーダーボードの入れ替え
MATH-Hard トップ 20 のランキングは完全に見直されました。Nvidia の AceMath モデルが今ではリーダーボードを支配し、それに続いて Qwen の派生モデルが続きます。一般リーダーボードのトップ 4 の位置は変わっていませんが、多くの他のモデルは数学のスコアが向上したことにより、総合ランキングで 200 位以上ランクアップしました。
結論
Math-Verify の採用により、Open LLM リーダーボードは特定の文字列形式に従う能力ではなく、モデルの実際の数学的能力を反映するようになります。Hugging Face は、研究者と開発者に対して、より信頼性の高い結果を得るために自身の内部評価で Math-Verify を使用することを推奨します。