chi2liu/ABC-GRPO

Code For All-Quadrant Bounded Clipping GRPO. arxiv.org/pdf/2601.03895

何を解決するか

ABC-GRPOは、標準的なグループ相対方策最適化(GRPO)に見られる不安定性と一般化の問題に対処します。特に、GRPOのクリッピング機構に「盲点」があり、負のアドバンテージと高い尤度比を持つ特定のトークン更新が無制限になることがあり、これにより過剰な罰則、エントロピーの崩壊、複数回の試行における問題解決能力の低下(Pass@kの劣化)を引き起こすことを修正します。

どう動くか

アドバンテージの符号に依存する2つの条件付きクリッピング境界ではなく、ABC-GRPOは4つの独立したクリッピング境界($\epsilon_1, \epsilon_2, \epsilon_3, \epsilon_4$)を導入します。これにより、アドバンテージが正であれ負であれ、比率-アドバンテージ空間の4つの象限すべてにおいて勾配更新が制限されるようになります。無条件の境界を提供することで、失敗したシーケンスにおける正しいトークンの過剰抑制を防ぎ、高いエントロピーを維持し、訓練中の探索能力を保ちます。

対象ユーザー

数学などの推論タスクに強化学習を用いて大規模言語モデル(LLM)を訓練する研究者や開発者で、訓練の安定性を向上させ、モデルが狭い回答の集合に早期に収束することを防ぎたい人。

主な特徴

  • 4境界クリッピング:条件付きクリッピングを、4つの象限すべてに独立したパラメータで置き換えます。
  • エントロピーの維持:GRPOよりも最大10.9倍高いエントロピーを維持し、エントロピーの崩壊リスクを低減します。
  • 一般化の向上:数学ベンチマーク(AIME、AMC)において、標準GRPOがしばしば劣化するのに対し、Pass@k指標で単調な改善を示します。
  • 更新の制限:Q2およびQ4象限における無制限の勾配更新を排除し、クリッピングイベントのほぼ半分をカバーします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト