Qwen GSPO: 언어 모델을 위한 확장 가능한 강화 학습
Qwen은 대규모 언어 모델에서 강화 학습을 확장할 때 발생하는 불안정성과 모델 붕괴 문제를 해결하도록 설계된 강화 학습(RL) 알고리즘인 그룹 시퀀스 정책 최적화(GSPO)를 도입했습니다. 토큰 수준 최적화에서 시퀀스 수준 최적화로 전환함으로써, GSPO는 학습 연산량이 증가함에 따라 지속적인 성능 향상을 가능하게 하고 전문가 혼합(MoE) 모델에 필요한 인프라를 단순화합니다.
시퀀스 수준 최적화 목표
GSPO는 토큰 수준 최적화를 시퀀스 수준 접근법으로 대체하여 안정성을 높이고 분산을 감소시킵니다. 이 알고리즘은 개별 토큰이 아닌 전체 시퀀스의 가능도에 기반한 중요도 비율을 정의합니다.
수치 범위를 통일하고 분산을 줄이기 위해 GSPO는 길이 정규화를 사용합니다. 최적화 목표는 다음과 같이 정의됩니다:
$$\mathcal{J}{\text{GSPO}} (\theta) = \mathbb{E}{x \sim \mathcal{D}, {y_{i}}{i=1}^{G} \sim \pi{\theta_{old}} (\cdot \mid x)} \left[\frac{1}{G} \sum_{i=1}^{G} \min \left(s_{i}(\theta)(\hat{A}){i}, \text{clip}(s{i}(\theta), 1-\epsilon, 1+\epsilon)(\hat{A})_{i}\right)\right]$$
여기서 시퀀스 수준 중요도 비율 $s_{i}(\theta)$는 다음과 같이 계산됩니다:
$$s_{i}(\theta) = \left(\frac{\pi_{\theta}(y_{i} \mid x)}{\pi_{\theta_{old}}(y_{i} \mid x)}\right)^{\frac{1}{|y_{i}|}} = \exp \left(\frac{1}{|y_{i}|} \sum_{t=1}^{|y_{i}|} \log \frac{\pi_{\theta}(y_{i,t} \mid x, y_{i,<t})}{\pi_{\theta_{old}}(y_{i,t} \mid x, y_{i,<t})}\right)$$
학습 효율성 및 확장성
GSPO는 그룹 상대 정책 최적화(GRPO)에 비해 높은 학습 효율성과 더 나은 확장성을 보여줍니다. Qwen3-30B-A3B-Base에서 파인튜닝된 콜드 스타트 모델을 사용한 실험 결과, 동일한 학습 비용 하에서 GSPO가 AIME'24, LiveCodeBench, CodeForces 벤치마크에서 우수한 성능을 달성함을 확인했습니다.
주요 확장성 발견 사항은 다음과 같습니다:
- 지속적인 개선: 학습 연산량 증가, 쿼리 세트의 정기적인 업데이트, 그리고 생성 길이 연장에 따라 성능이 계속 확장됩니다.
- 학습 신호 신뢰성: 토큰 클리핑 비율이 GRPO보다 두 자릿수 정도 높음에도 불구하고, GSPO는 더 높은 효율성을 달성합니다. 이는 토큰 수준 최적화가 시퀀스 수준 접근법보다 더 잡음이 많고 효과가 떨어진다는 것을 시사합니다.
전문가 혼합(MoE) 모델에서의 안정성
GSPO는 대규모 MoE 모델의 강화 학습 훈련에서 발생하는 안정성 문제를 근본적으로 해결하며, 특히 "Routing Replay" 필요성을 없앱니다.
GRPO에서는 전문가 활성화 변동성이 종종 수렴을 방해하여, 이전 정책($\pi_{\theta_{old}}$)에서 활성화된 전문가를 캐시하고 현재 정책($\pi_{\theta}$)에서 재생하는 Routing Replay 전략이 필요합니다. 이 우회 방법은 메모리와 통신 오버헤드를 증가시키며 모델 용량을 제한할 수 있습니다.
GSPO는 시퀀스 수준 가능도($\pi_{\theta}(y_{i} \mid x)$)에 초점을 맞추고 개별 토큰 가능도에 민감하지 않기 때문에 Routing Replay에 대한 의존성을 제거하고, 훈련 과정을 단순화하며 MoE 모델이 용량을 최대화할 수 있게 합니다.
인프라 및 정밀도 이점
GSPO의 시퀀스 수준 최적화는 훈련 과정이 정밀도 차이에 더 관대하도록 만듭니다. 이를 통해 추론 엔진에서 직접 반환된 가능도를 최적화에 사용할 수 있어, 훈련 엔진 내에서 다시 계산할 필요가 없어집니다. 이 기능은 특히 다음과 같은 경우에 유리합니다:
- 부분 롤아웃
- 다중 턴 RL
- 훈련-추론 분리 프레임워크
GSPO의 이러한 기술적 진보는 최신 Qwen3(Instruct, Coder, Thinking) 모델에서 관찰된 성능 향상의 알고리즘적 기반이 되었습니다.