Qwen2-Math リリースノート

QwenはQwen2-Mathを導入しました。これは複雑な算術や数学問題を解くことを目的とした、専門的な大規模言語モデルのシリーズです。フラッグシップモデルであるQwen2-Math-72B-Instructは最先端の性能を示し、GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro、Llama-3.1-405Bといったプロプライエタリモデルを主要な数学ベンチマークで上回ります。

モデルアーキテクチャとトレーニング

Qwen2-MathモデルはQwen2の基盤の上に構築され、1.5B、7B、72Bの3つのサイズで提供されます。開発プロセスは主に2つの段階で構成されています。

基礎モデル事前学習

ベースモデルはQwen2から初期化され、数学専用のコーパスで事前学習されます。このデータセットには以下が含まれます:

  • 高品質な数学のウェブテキストや書籍。
  • コードと試験問題。
  • Qwen2が合成した数学の事前学習データ。

インストラクションチューニング

Instructバージョンを作成するために、QwenはQwen2-Math-72Bをベースとした数学特化型リワードモデルを開発しました。トレーニングパイプラインは以下を利用します:

  • Rejection Sampling:密なリワードシグナルと二値の正確性シグナルを組み合わせて、教師ありファインチューニング(SFT)データを構築。
  • Reinforcement Learning:SFTフェーズの後にGroup Relative Policy Optimization(GRPO)を実装。

パフォーマンスと評価

Qwen2-Mathは、一般的な数学とコンペティションレベルの数学の両方をテストするために、英語と中国語の幅広いベンチマークで評価されました。

一般的な数学ベンチマーク

モデルはGSM8K、Math、MMLU-STEMでテストされました。Instructモデルについては、Greedy、Maj@8、RM@8(Reward Model)設定で性能が測定されました。結果は、特に1.5Bと7BモデルにおいてRM@8がMaj@8を上回り、数学リワードモデルの有効性を裏付けています。

コンペティションレベルの数学

Qwen2-Math-Instructは、以下のような非常に難易度の高いデータセットでテストされました:

  • English:OlympiadBench、CollegeMath、AIME 2024、AMC 2023。
  • Chinese:GaoKao(2024)、CN Middle School 24、CMATH。

AIME 2024やAMC 2023のような複雑なコンペティション評価において、モデルはGreedy、Maj@64、RM@64、RM@256設定で高い性能を示しました。

データ除染

ベンチマークの整合性を確保するために、Qwenは事前学習データと事後学習データの両方に対して厳格な除染手法を適用しました:

  • Exact Match:テストセットに含まれる同一サンプルを除去。
  • 13-gram Deduplication:最長共通シーケンス比が0.6を超えるサンプルを除去。
  • Targeted Filtering:GSM8K、MATH、Aqua、SAT Math、OlympiadBench、College Math、AIME24、AMC23などのデータセットから汚染されたサンプルを除去。

現在の制限とロードマップ

Qwen2-Mathは現在主に英語をサポートしています。ラボは英語と中国語のバイリンガルモデルのリリース計画を発表しており、さらなるアクセシビリティと機能拡張のために多言語モデルの開発も進めています。

Sources