chi2liu/ABC-GRPO

Code For All-Quadrant Bounded Clipping GRPO. arxiv.org/pdf/2601.03895

解决的问题

ABC-GRPO 解决了标准分组相对策略优化(GRPO)中存在的不稳定性与泛化问题。具体而言,它修复了 GRPO 的剪裁机制中的一个「盲点」:某些具有负优势和高似然比的 token 更新是无界的,导致过度惩罚、熵崩溃,以及模型在多次尝试中解决问题能力的下降(Pass@k 指标退化)。

工作原理

与依赖优势符号的两个条件性剪裁边界不同,ABC-GRPO 引入了 四个独立的剪裁边界($\epsilon_1, \epsilon_2, \epsilon_3, \epsilon_4$)。这确保了无论优势是正还是负,比率-优势空间的四个象限中的梯度更新都受到限制。通过提供无条件的边界,该算法防止模型在失败序列中过度抑制正确 token,从而保持更高的熵,并在训练过程中维持模型的探索能力。

适用人群

使用强化学习进行推理任务(如数学)训练大语言模型(LLM)的研究人员和开发者,希望提升训练稳定性,并防止模型过早收敛到一组狭窄的答案。

主要亮点

  • 4边界剪裁:用四个象限的独立参数替代条件性剪裁。
  • 熵的保持:显著维持更高的熵(比 GRPO 高达 10.9 倍),降低熵崩溃风险。
  • 泛化能力提升:在数学基准测试(AIME、AMC)上,Pass@k 指标表现出单调提升,而标准 GRPO 通常会退化。
  • 有界更新:消除了 Q2 和 Q4 象限中的无界梯度更新,这两个象限占所有剪裁事件的近一半。

相关

  • 项目
  • 项目
  • 项目
  • 项目