DeepMath: smolagents を使用した軽量な数学推論エージェント

DeepMath は Qwen3-4B Thinking をベースに構築された数学推論エージェントで、Group Relative Policy Optimization (GRPO) によってファインチューニングされています。冗長な chain-of-thought のトレースを、セキュアなサンドボックスで実行される簡潔な Python スニペットに置き換えることで、出力長を最大 66% 短縮し、精度を向上させることができます。

技術アーキテクチャとワークフロー

DeepMath は小型言語モデルと Python 実行環境を組み合わせ、決定的な計算をオフロードし、トレースの冗長性を削減します。システムは smolagents ライブラリを使用して実装され、推論エンジンとして vLLM を利用しています。

コアコンポーネント

  • Base Model: Qwen3-4B Thinking.
  • Agent Framework: smolagents を用いて、モデルが通常トークンまたは Python スニペットを含む特殊なエージェント呼び出しを出力できるようにします。
  • Execution Environment: インポート可能なモジュールの許可リストとスニペットごとのタイムアウトを備えたサンドボックス環境で、安全性を確保し任意のコード実行(例: ファイル I/O やネットワークアクセス)を防止します。

推論プロセス

推論時に、モデルは中間計算ステップ用の短い Python スニペットを生成します。これらのスニペットはサンドボックス内で実行され、結果は推論トレースに組み込まれ、以降のステップで決定的な結果を利用できるようになります。

GRPO を用いたトレーニング手法

DeepMath は TRL ライブラリを介して Group Relative Policy Optimization (GRPO) を使用してファインチューニングされます。トレーニングプロセスは、冗長さよりも正確さと簡潔さを報酬することに重点を置きます。

報酬構造

  • Accuracy Reward: 正しい最終回答に対して +1。
  • Code Snippet Reward: コードスニペット生成に対して +1(正確さの報酬に対して 10:1 の重み付け)。
  • Length Penalty: 出力を短くするように、GRPO の完了候補を 5,000 トークンに制限します。

トレーニング最適化

  • Temperature Scheduling: 初期探索と後期安定性のバランスを取るため、線形スケジュール (T=1.2 から T=0.7) を使用します。
  • In-context Learning: エージェント呼び出しと実行結果を含む 4 つの解答例を提示し、必要な構文と応答パターンを学習させます。
  • Dataset: OpenMathReasoning データセットの Tool-Integrated Reasoning (TIR) サブセットを使用し、外部ツール利用が有益な問題に焦点を当てます。

評価とパフォーマンス

DeepMath は MATH500、AIME、HMMT、HLE の 4 つのデータセットでベンチマークされました。評価ではロバスト性のために majority@16 を使用し、簡潔さを測るために平均出力長を測定しました。

主な発見

  • Efficiency: エージェント方式により出力長が大幅に削減され、ベースラインと比較して最大 66% の短縮が達成されました。
  • Synergy: アブレーション研究により、エージェント推論単体でも長さは削減できるものの、GRPO トレーニングとエージェント推論を組み合わせたときに最良の結果が得られることが示されました。
  • Accuracy: DeepMath はベースラインの Qwen3-4B-Thinking-2507 モデルと比較して、より短いトレースにもかかわらず、難易度の高いデータセットで高い正確性を示しました。

示唆と限界

計算をサンドボックスにオフロードすることで算術エラーが減少し、出力が短くなるため推論速度が向上します。ただし、研究者は以下の限界を指摘しています。

  • Scope: 現在は小型モデルと数学推論に限定されています。
  • Generalization: コンテスト形式の数学問題で評価されており、形式的証明やオープンエンドな数学的創造性への転用は保証されません。
  • Security: 厳格なサンドボックスとリソース制限があるものの、生成コードの実行は固有のリスクを伴い、慎重なデプロイ管理が必要です。

SUMMARY: DeepMath は Qwen3-4B Thinking をベースとし、GRPO でファインチューニングされた数学推論エージェントです。冗長なテキストを簡潔な Python スニペットに置き換えて決定的な計算を行い、出力長を最大66%削減しながら精度を向上させます。

TITLE: DeepMath: smolagents を使用した軽量な数学推論エージェント

Sources