Qwen GSPO:可擴展的語言模型強化學習

Qwen 推出了群組序列策略優化(Group Sequence Policy Optimization,簡稱 GSPO),這是一種強化學習(RL)演算法,旨在解決在大型語言模型中擴展 RL 時所面臨的不穩定性與模型崩潰問題。透過從 token 級別轉向序列級別的優化,GSPO 能在訓練算力提升時持續提升效能,並簡化混合專家(Mixture-of-Experts,簡稱 MoE)模型所需的基礎設施。

序列級別優化目標

GSPO 用序列級別的方法取代 token 級別的優化,以提升穩定性並降低變異。該演算法根據整個序列的似然度(而非單一 token)定義重要性比率。

為了統一數值範圍並降低變異,GSPO 採用長度正規化。優化目標定義如下:

$$\mathcal{J}{\text{GSPO}} (\theta) = \mathbb{E}{x \sim \mathcal{D}, {y_{i}}{i=1}^{G} \sim \pi{\theta_{old}} (\cdot \mid x)} \left[\frac{1}{G} \sum_{i=1}^{G} \min \left(s_{i}(\theta)(\hat{A}){i}, \text{clip}(s{i}(\theta), 1-\epsilon, 1+\epsilon)(\hat{A})_{i}\right)\right]$$

其中,序列級別的重要性比率 $s_{i}(\theta)$ 計算方式為:

$$s_{i}(\theta) = \left(\frac{\pi_{\theta}(y_{i} \mid x)}{\pi_{\theta_{old}}(y_{i} \mid x)}\right)^{\frac{1}{|y_{i}|}} = \exp \left(\frac{1}{|y_{i}|} \sum_{t=1}^{|y_{i}|} \log \frac{\pi_{\theta}(y_{i,t} \mid x, y_{i,<t})}{\pi_{\theta_{old}}(y_{i,t} \mid x, y_{i,<t})}\right)$$

訓練效率與可擴展性

與 Group Relative Policy Optimization(GRPO)相比,GSPO 展示出更高的訓練效率與更佳的可擴展性。使用從 Qwen3-30B-A3B-Base 微調的冷啟動模型進行實驗,結果顯示在相同訓練成本下,GSPO 在 AIME'24、LiveCodeBench 與 CodeForces 基準測試上取得更優異的表現。

關於可擴展性的主要發現包括:

  • 持續改進:效能隨著訓練算力提升、查詢集的定期更新以及生成長度的延長而持續提升。
  • 學習訊號可靠性:即使 token 裁剪比例比 GRPO 高出兩個數量級,GSPO 仍能達到更高的效率,暗示 token 級別的優化較為噪聲且效能不如序列級別的方法。

Mixture-of-Experts(MoE)模型的穩定性

GSPO 天然解決了大型 MoE 模型在 RL 訓練中的穩定性挑戰,特別是消除了「Routing Replay」的需求。

在 GRPO 中,專家激活的波動性常導致無法收斂,需採用 Routing Replay 策略,將舊策略($\pi_{\theta_{old}}$)中被激活的專家快取起來,並在當前策略($\pi_{\theta}$)中重新播放。此變通做法會增加記憶體與通訊開銷,且可能限制模型容量。

由於 GSPO 專注於序列級別的似然度($\pi_{\theta}(y_{i} \mid x)$),且對單一 token 的似然度不敏感,因而不再依賴 Routing Replay,簡化了訓練流程,讓 MoE 模型得以發揮最大容量。

基礎設施與精度優勢

GSPO 的序列級別優化使訓練過程對精度差異更具容忍度。這允許直接使用推論引擎回傳的似然度進行優化,免除在訓練引擎內重新計算的需求。此功能在以下情境中特別有利:

  • 部分 rollout
  • 多回合 RL
  • 訓練‑推論分離的框架

這些 GSPO 的技術進步成為最新 Qwen3(Instruct、Coder 與 Thinking)模型效能提升的演算法基礎。

Sources