Qwen2.5-Math リリースノート
Qwen は Qwen2.5-Math のリリースを発表しました。これは英語と中国語で高精度な推論を行うことを目的とした、専門的な数学向け大規模言語モデル(LLM)シリーズです。このシリーズは、計算精度を向上させ複雑なアルゴリズム課題を解決するために、Chain-of-Thought(CoT)に加えて Tool-Integrated Reasoning(TIR)を導入し、フラッグシップの 72B モデルをオープンソースの数学 LLM のリーダーとして位置付けています。
モデルラインナップと機能
Qwen2.5-Math は、性能と効率のバランスを取るために複数の構成で提供されています。
- ベースモデル: Qwen2.5-Math-1.5B、7B、72B。
- 指示チューニングモデル: Qwen2.5-Math-1.5B-Instruct、7B-Instruct、72B-Instruct。
- リワードモデル: Qwen2.5-Math-RM-72B(データ構築と強化学習に使用)。
従来の Qwen2-Math シリーズが英語の CoT に焦点を当てていたのに対し、Qwen2.5-Math は 中国語と英語の両方 をサポートし、Tool-Integrated Reasoning(TIR) を導入しました。TIR により、モデルは Python インタプリタなどのツールを利用して正確な計算や記号操作を行うことができ、行列の固有値や二次方程式の解といった複雑な計算を扱う際の CoT の限界を克服します。
技術的改善と学習パイプライン
Qwen2.5-Math モデルは、以下の 3 つの主要手法で Qwen2-Math ベースモデルをアップグレードする形で開発されました。
- 合成データ: Qwen2-Math-72B-Instruct を使用して高品質な数学事前学習データを生成。
- コーパス拡張: 書籍、ウェブ、コードなどから高品質な数学データをさらに集約し、特に中国語データを増強。Qwen Math Corpus v2 は 700B トークンから 1T トークン以上に拡大。
- パラメータ初期化: 言語理解とコード生成が向上した Qwen2.5 シリーズのベースモデルを活用。
指示チューニングモデルについては、Qwen は数学特化型リワードモデル(Qwen2.5-Math-RM-72B)を用いて、リジェクションサンプリングにより教師あり微調整(SFT)データを構築し、Group Relative Policy Optimization(GRPO)を用いた強化学習を導きました。
パフォーマンスベンチマーク
Qwen2.5-Math は前世代に対して大幅な性能向上を示し、主要なクローズドソースモデルと競合します。
一般数学
- フラッグシップ性能: Qwen2.5-Math-72B-Instruct は英語で平均 4.4 ポイント、中国語で 6.1 ポイント上回ります。
- TIR の優位性: TIR 設定(RM@8)で 72B-Instruct モデルは MATH ベンチマークで 92.9 点を取得。
- 効率性: Qwen2.5-Math-7B-Instruct は従来の Qwen2-Math-Instruct 72B を上回り、MATH スコアは CoT で 83.6、TIR で 85.3 を達成。
- 小型モデルの能力: 1.5B-Instruct は Python インタプリタ使用時に約 80 点の MATH スコアを記録。
複雑な競技数学
AIME 2024 ベンチマークでは、Claude 3 Opus、GPT-4 Turbo、Gemini 1.5 Pro といったクローズドソースモデルが 30 問中 1〜2 問しか解けなかったのに対し、Qwen2.5-Math-72B-Instruct は Greedy CoT モードで 9 問、TIR モードで 12 問を解きました。リワードモデルを併用した 7B-Instruct は最大で 21 問を解答しました。
評価の信頼性とデコンタミネーション
データ漏洩を防ぎ偏りのない結果を保証するため、Qwen は厳格なデコンタミネーションプロセスを実施しました。
- 13‑gram マッチング: テキスト正規化後に潜在的に汚染された学習サンプルを除外。
- 最長共通部分列(LCS): 比率が 0.6 を超える場合に汚染と判定、特に一般的な数学式に適用。
- データセットフィルタリング: GSM8K、MATH、Minerva Math、Olympiad Bench、AIME 24 など多数のテストセットに対してサンプルをフィルタリング。
実装とデモ
Qwen はモデルを体験するための主な方法を 2 つ提供しています。
- TIR デモ: Qwen-Agent に統合されており、ローカルでコードを実行して Tool-Integrated Reasoning を利用可能。
- マルチモーダルデモ: Hugging Face と Modelscope で提供され、Qwen2-VL の OCR と Qwen2-Math の推論を組み合わせて画像、テキスト、手書きスケッチの数学問題を処理。