chi2liu/ABC-GRPO

Code For All-Quadrant Bounded Clipping GRPO. arxiv.org/pdf/2601.03895

해결하는 문제

ABC-GRPO는 표준 그룹 상대적 정책 최적화(GRPO)에서 발견되는 불안정성과 일반화 문제를 해결합니다. 특히 GRPO의 클리핑 메커니즘에 '눈멀어진 영역'이 존재하여, 음의 이점과 높은 가능도 비율을 가진 특정 토큰 업데이트가 제한 없이 이루어져 과도한 처벌, 엔트로피 붕괴, 여러 시도에서 문제 해결 능력 저하(패스@k 저하)를 초래한다는 점을 수정합니다.

작동 방식

이점의 부호에 따라 달라지는 두 개의 조건부 클리핑 경계를 사용하는 대신, ABC-GRPO는 4개의 독립적인 클리핑 경계($\epsilon_1, \epsilon_2, \epsilon_3, \epsilon_4$)를 도입합니다. 이는 이점의 부호에 관계없이 비율-이점 공간의 4개의 사분면에서 모두 기울기 업데이트가 제한되도록 보장합니다. 조건 없이 경계를 제공함으로써, 실패한 시퀀스에서 올바른 토큰을 과도하게 억제하는 것을 방지하고, 더 높은 엔트로피를 유지하며 학습 중 탐색 능력을 유지합니다.

대상 사용자

수학과 같은 추론 작업을 위해 강화학습을 사용하여 대규모 언어 모델(LLM)을 훈련하는 연구자 및 개발자로, 훈련의 안정성을 향상시키고 모델이 좁은 답변 집합으로 조기 수렴하는 것을 방지하고자 하는 사람들을 대상으로 합니다.

주요 특징

  • 4경계 클리핑: 조건부 클리핑을 4개 사분면 모두에 독립적인 파라미터로 대체합니다.
  • 엔트로피 유지: GRPO보다 최대 10.9배 높은 엔트로피를 유지하여 엔트로피 붕괴 위험을 줄입니다.
  • 일반화 향상: 표준 GRPO가 종종 저하되는 수학 벤치마크(AIME, AMC)에서 Pass@k 지표가 단조로운 개선을 보입니다.
  • 제한된 업데이트: Q2 및 Q4 사분면에서 무제한 기울기 업데이트를 제거하여 클리핑 이벤트의 거의 절반을 차지합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트