Qwen GSPO:可扩展的语言模型强化学习

Qwen 引入了 Group Sequence Policy Optimization (GSPO),这是一种强化学习(RL)算法,旨在解决在大语言模型中扩展 RL 时出现的不稳定性和模型崩溃问题。通过从 token 级别优化转向序列级别优化,GSPO 能够在训练算力提升时实现持续的性能提升,并简化了混合专家(Mixture‑of‑Experts,MoE)模型所需的基础设施。

序列级优化目标

GSPO 用序列级别的方法取代了 token 级别的优化,以提升稳定性并降低方差。该算法基于整个序列的似然度而非单个 token 定义重要性比率。

为了统一数值范围并降低方差,GSPO 采用了长度归一化。优化目标定义如下:

$$\mathcal{J}{\text{GSPO}} (\theta) = \mathbb{E}{x \sim \mathcal{D}, {y_{i}}{i=1}^{G} \sim \pi{\theta_{old}} (\cdot \mid x)} \left[\frac{1}{G} \sum_{i=1}^{G} \min \left(s_{i}(\theta)(\hat{A}){i}, \text{clip}(s{i}(\theta), 1-\epsilon, 1+\epsilon)(\hat{A})_{i}\right)\right]$$

其中序列级重要性比率 $s_{i}(\theta)$ 的计算方式为:

$$s_{i}(\theta) = \left(\frac{\pi_{\theta}(y_{i} \mid x)}{\pi_{\theta_{old}}(y_{i} \mid x)}\right)^{\frac{1}{|y_{i}|}} = \exp \left(\frac{1}{|y_{i}|} \sum_{t=1}^{|y_{i}|} \log \frac{\pi_{\theta}(y_{i,t} \mid x, y_{i,<t})}{\pi_{\theta_{old}}(y_{i,t} \mid x, y_{i,<t})}\right)$$

训练效率与可扩展性

与 Group Relative Policy Optimization (GRPO) 相比,GSPO 展示了更高的训练效率和更好的可扩展性。使用从 Qwen3-30B-A3B-Base 冷启动微调的模型进行实验,结果表明在相同的训练成本下,GSPO 在 AIME'24、LiveCodeBench 和 CodeForces 基准上取得了更优的表现。

可扩展性的关键发现包括:

  • 持续改进:性能随训练算力的提升、查询集的定期更新以及生成长度的延长而继续提升。
  • 学习信号可靠性:尽管 GSPO 的 token 裁剪比例比 GRPO 高出两个数量级,但其效率更高,这表明 token 级别的优化更嘈杂、效果不如序列级别的方法。

在混合专家(MoE)模型中的稳定性

GSPO 本质上解决了大规模 MoE 模型 RL 训练中的稳定性挑战,特别是消除了对 “Routing Replay” 的需求。

在 GRPO 中,专家激活的波动性常导致收敛困难,需要一种 Routing Replay 策略:将旧策略 ($\pi_{\theta_{old}}$) 中激活的专家缓存下来,并在当前策略 ($\pi_{\theta}$) 中重新播放。这种变通办法会增加内存和通信开销,并可能限制模型容量。

由于 GSPO 关注序列级似然度 ($\pi_{\theta}(y_{i} \mid x)$),对单个 token 的似然度不敏感,它消除了对 Routing Replay 的依赖,简化了训练流程,使 MoE 模型能够充分发挥其容量。

基础设施与精度优势

GSPO 的序列级优化使训练过程对精度差异更具容忍度。这允许直接使用推理引擎返回的似然度进行优化,无需在训练引擎内部重新计算。这一特性在以下场景尤为有利:

  • 部分 rollout
  • 多轮 RL
  • 训练‑推理解耦框架

这些技术进步为最新的 Qwen3(Instruct、Coder、Thinking)系列模型的性能提升提供了算法基础。

Sources