Qwen GSPO:可扩展的语言模型强化学习
Qwen 引入了 Group Sequence Policy Optimization (GSPO),这是一种强化学习(RL)算法,旨在解决在大语言模型中扩展 RL 时出现的不稳定性和模型崩溃问题。通过从 token 级别优化转向序列级别优化,GSPO 能够在训练算力提升时实现持续的性能提升,并简化了混合专家(Mixture‑of‑Experts,MoE)模型所需的基础设施。
序列级优化目标
GSPO 用序列级别的方法取代了 token 级别的优化,以提升稳定性并降低方差。该算法基于整个序列的似然度而非单个 token 定义重要性比率。
为了统一数值范围并降低方差,GSPO 采用了长度归一化。优化目标定义如下:
$$\mathcal{J}{\text{GSPO}} (\theta) = \mathbb{E}{x \sim \mathcal{D}, {y_{i}}{i=1}^{G} \sim \pi{\theta_{old}} (\cdot \mid x)} \left[\frac{1}{G} \sum_{i=1}^{G} \min \left(s_{i}(\theta)(\hat{A}){i}, \text{clip}(s{i}(\theta), 1-\epsilon, 1+\epsilon)(\hat{A})_{i}\right)\right]$$
其中序列级重要性比率 $s_{i}(\theta)$ 的计算方式为:
$$s_{i}(\theta) = \left(\frac{\pi_{\theta}(y_{i} \mid x)}{\pi_{\theta_{old}}(y_{i} \mid x)}\right)^{\frac{1}{|y_{i}|}} = \exp \left(\frac{1}{|y_{i}|} \sum_{t=1}^{|y_{i}|} \log \frac{\pi_{\theta}(y_{i,t} \mid x, y_{i,<t})}{\pi_{\theta_{old}}(y_{i,t} \mid x, y_{i,<t})}\right)$$
训练效率与可扩展性
与 Group Relative Policy Optimization (GRPO) 相比,GSPO 展示了更高的训练效率和更好的可扩展性。使用从 Qwen3-30B-A3B-Base 冷启动微调的模型进行实验,结果表明在相同的训练成本下,GSPO 在 AIME'24、LiveCodeBench 和 CodeForces 基准上取得了更优的表现。
可扩展性的关键发现包括:
- 持续改进:性能随训练算力的提升、查询集的定期更新以及生成长度的延长而继续提升。
- 学习信号可靠性:尽管 GSPO 的 token 裁剪比例比 GRPO 高出两个数量级,但其效率更高,这表明 token 级别的优化更嘈杂、效果不如序列级别的方法。
在混合专家(MoE)模型中的稳定性
GSPO 本质上解决了大规模 MoE 模型 RL 训练中的稳定性挑战,特别是消除了对 “Routing Replay” 的需求。
在 GRPO 中,专家激活的波动性常导致收敛困难,需要一种 Routing Replay 策略:将旧策略 ($\pi_{\theta_{old}}$) 中激活的专家缓存下来,并在当前策略 ($\pi_{\theta}$) 中重新播放。这种变通办法会增加内存和通信开销,并可能限制模型容量。
由于 GSPO 关注序列级似然度 ($\pi_{\theta}(y_{i} \mid x)$),对单个 token 的似然度不敏感,它消除了对 Routing Replay 的依赖,简化了训练流程,使 MoE 模型能够充分发挥其容量。
基础设施与精度优势
GSPO 的序列级优化使训练过程对精度差异更具容忍度。这允许直接使用推理引擎返回的似然度进行优化,无需在训练引擎内部重新计算。这一特性在以下场景尤为有利:
- 部分 rollout
- 多轮 RL
- 训练‑推理解耦框架
这些技术进步为最新的 Qwen3(Instruct、Coder、Thinking)系列模型的性能提升提供了算法基础。