SAPO: 대형 언어 모델 훈련을 위한 안정적이고 성능 좋은 강화 학습 방법

TL;DR

Qwen은 대형 언어 모델(LLM)의 훈련을 안정화하도록 설계된 강화 학습(RL) 방법인 Soft Adaptive Policy Optimization (SAPO)을 도입했습니다. 기존의 GRPO 및 GSPO와 같은 방법에서 사용되는 하드 클리핑 메커니즘을 부드럽고 온도 제어 게이팅 함수로 대체함으로써, SAPO는 불안정한 정책 업데이트를 방지하고 보다 유용한 그래디언트 정보를 보존하여 추론, 코딩 및 멀티모달 작업에서 높은 성능을 달성합니다.

LLM에서 정책 최적화의 도전 과제

LLM에서는 안정적인 정책 최적화가 어려운데, 특히 대형 Mixture-of-Experts(MoE) 모델에서는 토큰 수준 중요도 비율의 분산 때문에 그렇습니다. 이러한 비율은 현재 정책이 학습 샘플을 생성하는 데 사용된 행동 정책으로부터 얼마나 벗어났는지를 측정합니다.

기존의 그룹 기반 정책 최적화 방법은 하드 클리핑을 통해 이러한 불안정을 제어하려고 시도합니다:

  • GRPO (토큰 수준 클리핑): 중요도 비율이 고정된 구간을 벗어날 때마다 그래디언트를 잘라냅니다.
  • GSPO (시퀀스 수준 클리핑): 시퀀스 수준에서 클리핑을 적용합니다.

이러한 하드 클리핑 접근법은 두 가지 주요 제한점이 있습니다: 학습 신호의 손실(유익한 샘플이 버려짐)과 안정성 및 샘플 효율성 사이의 취약한 트레이드오프. 클리핑 범위가 너무 좁으면 유용한 그래디언트가 손실되고, 너무 넓으면 잡음이 많은 그래디언트가 모델을 불안정하게 만듭니다.

Soft Adaptive Policy Optimization (SAPO) 설명

SAPO는 하드 클리핑을 부드러운 게이팅 함수 $f_{i,t}(x) = \frac{4}{\tau_{i,t}} \cdot \sigma\big(\tau_{i,t}(x - 1)\big)$ 로 대체함으로써 이러한 제한점을 해결합니다. 이 함수는 급격히 차단하는 대신 오프‑정책 업데이트의 가중치를 적응적으로 낮춥니다.

핵심 기술 특징

  • Continuous Trust Regions: SAPO는 하드 클리핑과 관련된 불연속성을 피하고, 정책이 벗어날수록 기여도가 부드럽게 감소하도록 합니다.
  • Sequence-Level Coherence: SAPO는 GSPO에서 보이는 시퀀스 수준 행동을 유지합니다. 그러나 몇몇 토큰만 오프‑정책인 경우 전체 시퀀스를 억제하는 GSPO와 달리, SAPO는 문제 토큰만 억제하여 다른 유용한 그래디언트를 보존하고 샘플 효율성을 향상시킵니다.
  • Token-Level Adaptivity: 이 방법은 너무 멀리 오프‑정책인 토큰을 선택적으로 억제할 수 있어, 전체 학습 신호를 버리지 않고도 불안정한 정책 변화를 방지합니다.
  • Asymmetric Temperature Design: SAPO는 양의 이점과 음의 이점에 대해 서로 다른 온도를 사용합니다($\tau_{\text{neg}} > \tau_{\text{pos}}$). 음의 이점은 대규모 어휘에서 많은 부적절한 토큰의 로짓을 증가시킬 수 있기 때문에, 음의 토큰에 높은 온도를 적용하면 오프‑정책일 때 해당 기여도가 더 빠르게 감소하여 훈련 안정성을 크게 향상시킵니다.

실험 결과

Qwen은 밀집 모델과 MoE 모델을 포함한 다양한 모델 아키텍처에서 SAPO를 테스트했습니다.

수학적 추론 (Qwen3-30B-A3B)

Qwen3-30B-A3B-Base에서 파인튜닝된 콜드‑스타트 모델을 사용하여 SAPO를 GSPO 및 GRPO‑R2(GRPO with routing replay)와 비교했습니다. 결과는 다음과 같습니다:

  • SAPO는 GSPO와 GRPO‑R2보다 더 오랜 기간 동안 안정적인 훈련을 유지했습니다.
  • SAPO는 AIME25, HMMT25 및 BeyondAIME 벤치마크에서 최종 Pass@1 점수가 더 높았습니다.
  • SAPO는 라우팅 리플레이가 필요 없게 하여 RL 파이프라인을 단순화했습니다.

대규모 RL for Qwen3-VL 모델

SAPO는 수학, 코딩, 논리 및 멀티모달 작업이 혼합된 Qwen3-VL-30B-A3B에 적용되었습니다. 평가 벤치마크에는 AIME25, LiveCodeBench v6, ZebraLogic 및 MathVision이 포함되었습니다. 결과는 SAPO가 모델 크기와 MoE 및 밀집 아키텍처 모두에서 동일한 계산 예산 하에 GSPO와 GRPO‑R2보다 일관되게 우수한 성능을 보였음을 나타냈습니다.

LLM 훈련에 대한 시사점

SAPO는 업데이트가 시퀀스 수준 행동과 정렬되면서도 토큰 수준 유연성을 유지하도록 보장함으로써 RL 훈련을 향상시키는 실용적인 프레임워크를 제공합니다. 하드 클리핑의 취약성을 해결하고 비대칭 온도 제어를 구현함으로써, SAPO는 고분산 업데이트의 영향을 감소시켜 향후 RL‑훈련 LLM에 보다 안정적이고 효율적인 기본 구성 요소가 됩니다.

Sources