chi2liu/ABC-GRPO

Code For All-Quadrant Bounded Clipping GRPO. arxiv.org/pdf/2601.03895

解決的問題

ABC-GRPO 解決了標準分組相對策略優化(GRPO)中出現的不穩定性與泛化問題。具體而言,它修復了 GRPO 剪裁機制中的「盲點」:某些具有負向優勢與高機率比的 token 更新是無界的,導致過度懲罰、熵崩潰,以及模型在多次嘗試中解決問題能力的下降(Pass@k 指標退化)。

工作原理

與依賴優勢符號的兩個條件性剪裁邊界不同,ABC-GRPO 引入了 四個獨立的剪裁邊界($\epsilon_1, \epsilon_2, \epsilon_3, \epsilon_4$)。這確保了無論優勢是正或負,比率-優勢空間的四個象限中的梯度更新皆受限制。透過提供無條件的邊界,該演算法防止模型在失敗序列中過度抑制正確 token,從而維持更高的熵,並在訓練過程中保持模型的探索能力。

適用對象

使用強化學習進行推理任務(如數學)訓練大語言模型(LLM)的研究人員與開發者,希望提升訓練穩定性,並防止模型過早收斂至一組狹窄的答案。

主要亮點

  • 4邊界剪裁:以四個象限的獨立參數取代條件性剪裁。
  • 熵的維持:顯著維持更高的熵(比 GRPO 高達 10.9 倍),降低熵崩潰風險。
  • 泛化能力提升:在數學基準測試(AIME、AMC)上,Pass@k 指標表現出單調提升,而標準 GRPO 通常會退化。
  • 有界更新:消除 Q2 與 Q4 象限中的無界梯度更新,這兩個象限佔所有剪裁事件的近一半。

相關

  • 專案
  • 專案
  • 專案
  • 專案