SAPO:一種穩定且高效能的強化學習方法,用於訓練大型語言模型
TL;DR
Qwen 推出了 Soft Adaptive Policy Optimization(SAPO),這是一種旨在穩定大型語言模型(LLM)訓練的強化學習(RL)方法。SAPO 以平滑、受溫度控制的 gating 函數取代了現有方法(如 GRPO 與 GSPO)中的硬裁剪機制,從而防止不穩定的策略更新,同時保留更多有用的梯度資訊,提升了推理、程式碼撰寫與多模態任務的效能。
LLM 中策略最佳化的挑戰
在 LLM,尤其是大型 Mixture-of-Experts(MoE)模型中,策略最佳化的穩定性相當困難,原因在於 token 級別重要性比率的變異性。這些比率衡量了當前策略相對於產生訓練樣本的行為策略的偏離程度。
現有的基於群組的策略最佳化方法試圖透過硬裁剪來控制這種不穩定性:
- GRPO(token 級別裁剪): 當重要性比率超出固定區間時截斷梯度。
- GSPO(序列級別裁剪): 在序列層面執行裁剪。
這些硬裁剪方法存在兩大限制:學習訊號的流失(資訊豐富的樣本被丟棄)以及在穩定性與樣本效率之間的脆弱權衡。若裁剪範圍過窄,會失去有用的梯度;若範圍過寬,噪聲梯度則會使模型不穩定。
Soft Adaptive Policy Optimization(SAPO)說明
SAPO 透過將硬裁剪換成平滑的 gating 函數 $f_{i,t}(x) = \frac{4}{\tau_{i,t}} \cdot \sigma\big(\tau_{i,t}(x - 1)\big)$ 來克服上述限制。此函數會自適應地降低 off‑policy 更新的權重,而不是直接截斷。
主要技術特點
- 連續信任區間: SAPO 避免了硬裁剪所帶來的不連續性,隨著策略偏離程度的增加,貢獻會平滑衰減。
- 序列層面的連貫性: SAPO 保留了 GSPO 的序列層面行為。但不同於 GSPO 在少數 token off‑policy 時會整個序列被抑制,SAPO 只抑制問題 token,從而保留其他有用的梯度,提高樣本效率。
- Token 級別自適應: 該方法允許對過度 off‑policy 的 token 進行選擇性抑制,防止不穩定的策略變化,同時不拋棄整體學習訊號。
- 非對稱溫度設計: SAPO 為正向與負向 advantage 使用不同的溫度($\tau_{\text{neg}} > \tau_{\text{pos}}$)。由於負向 advantage 可能在大型詞彙表中提升大量不適當 token 的 logits,較高的負向溫度使這些貢獻在 off‑policy 時衰減更快,顯著提升訓練穩定性。
實驗結果
Qwen 在多種模型架構上測試了 SAPO,涵蓋密集模型與 MoE 模型。
數學推理(Qwen3-30B-A3B)
使用從 Qwen3-30B-A3B-Base 冷啟動微調的模型,將 SAPO 與 GSPO 以及 GRPO‑R2(帶路由重放的 GRPO)進行比較。結果顯示:
- SAPO 的訓練穩定性較 GSPO 與 GRPO‑R2 更持久。
- SAPO 在 AIME25、HMMT25 與 BeyondAIME 基準上取得更高的最終 Pass@1 分數。
- SAPO 免除路由重放的需求,簡化了 RL 流程。
大規模 RL 用於 Qwen3‑VL 模型
SAPO 被應用於 Qwen3‑VL-30B-A3B,涵蓋數學、程式碼、邏輯與多模態任務的混合。評估基準包括 AIME25、LiveCodeBench v6、ZebraLogic 與 MathVision。結果顯示,在相同計算預算下,無論模型規模或是 MoE 與密集架構,SAPO 均持續優於 GSPO 與 GRPO‑R2。
對 LLM 訓練的啟示
SAPO 提供了一個實用框架,透過確保更新與序列層面行為保持一致,同時保有 token 級別的彈性,提升 RL 訓練的穩定性與效率。透過解決硬裁剪的脆弱性並實施非對稱溫度控制,SAPO 減少了高變異更新的衝擊,成為未來 RL 訓練 LLM 的更穩定且高效的基礎組件。