SAPO:一种稳定且高性能的强化学习方法,用于训练大语言模型

TL;DR

Qwen 推出了软自适应策略优化(Soft Adaptive Policy Optimization,SAPO),这是一种强化学习(RL)方法,旨在稳定大语言模型(LLMs)的训练。通过用平滑、温度控制的门控函数取代 GRPO、GSPO 等现有方法中的硬裁剪机制,SAPO 防止了不稳定的策略更新,同时保留了更多有用的梯度信息,从而在推理、编码和多模态任务上实现更高的性能。

大语言模型中策略优化的挑战

在 LLM 中实现稳定的策略优化非常困难,尤其是对于大型的混合专家(Mixture‑of‑Experts,MoE)模型,因为 token 级重要性比率的方差很大。该比率衡量当前策略相对于用于生成训练样本的行为策略的偏离程度。

现有的基于分组的策略优化方法尝试通过硬裁剪来控制这种不稳定性:

  • GRPO(token 级裁剪): 当重要性比率超出固定区间时截断梯度。
  • GSPO(序列级裁剪): 在序列层面进行裁剪。

这些硬裁剪方法存在两个主要局限:学习信号的丢失(有价值的样本被舍弃)以及在稳定性与样本效率之间的脆弱权衡。如果裁剪范围过窄,有用的梯度会丢失;如果范围过宽,噪声梯度会导致模型不稳定。

软自适应策略优化(SAPO)原理

SAPO 通过用平滑门控函数 $f_{i,t}(x) = \frac{4}{\tau_{i,t}} \cdot \sigma\big(\tau_{i,t}(x - 1)\big)$ 替代硬裁剪来解决上述局限。该函数会自适应地降低离策略更新的权重,而不是突然将其截断。

关键技术特性

  • 连续信任域: SAPO 避免了硬裁剪带来的不连续性,在策略偏离时提供平滑的贡献衰减。
  • 序列级一致性: SAPO 保持了 GSPO 中的序列级行为。但不同于 GSPO 在少数 token 离策略时会抑制整条序列,SAPO 只抑制有问题的 token,从而保留其他有用梯度,提高样本效率。
  • Token 级自适应: 该方法能够选择性地抑制过度离策略的 token,防止不稳定的策略漂移,同时不丢弃整体学习信号。
  • 非对称温度设计: SAPO 为正向优势和负向优势使用不同的温度 ($\tau_{\text{neg}} > \tau_{\text{pos}}$)。由于负向优势会在大词表中提升大量不恰当 token 的 logits,较高的负向温度使这些离策略的贡献衰减更快,显著提升训练稳定性。

实验结果

Qwen 在多种模型架构上测试了 SAPO,包括密集模型和 MoE 模型。

数学推理(Qwen3-30B-A3B)

使用从 Qwen3-30B-A3B-Base 微调得到的冷启动模型,SAPO 与 GSPO 以及 GRPO‑R2(带路由回放的 GRPO)进行对比。结果显示:

  • SAPO 的训练稳定性优于 GSPO 和 GRPO‑R2,能够保持更长时间的稳定训练。
  • 在 AIME25、HMMT25 和 BeyondAIME 基准上,SAPO 获得了更高的最终 Pass@1 分数。
  • SAPO 省去了路由回放的需求,简化了 RL 流程。

大规模 RL(针对 Qwen3‑VL 模型)

SAPO 被应用于 Qwen3‑VL‑30B‑A3B,在数学、编码、逻辑和多模态任务的混合上进行训练。评估基准包括 AIME25、LiveCodeBench v6、ZebraLogic 和 MathVision。实验发现,在相同算力预算下,SAPO 在不同模型规模以及 MoE 与密集架构上始终优于 GSPO 和 GRPO‑R2。

对 LLM 训练的意义

SAPO 提供了一个实用框架,通过确保更新与序列级行为保持一致,同时保留 token 级的灵活性,来提升 RL 训练效果。通过解决硬裁剪的脆弱性并实现非对称温度控制,SAPO 减少了高方差更新的影响,使其成为未来 RL 训练 LLM 的更稳定、高效的基础组件。

Sources