Policy Gradient, PPO Clipping, and Chain‑of‑Thought RL for LLMs – Stanford CS229 Lecture 20

策略梯度推導與基線

策略梯度定理指出,預期回報的梯度等於隨時間的動作對數概率梯度之和乘以回報的期望。由於在沒有獎勵時,對數概率梯度的期望為零,任何不依賴於動作的項可以被加入或減去而不改變期望。這個特性允許引入僅依賴於狀態的基線;減去這樣的基線不會改變預期梯度,但在實際上可以降低方差。

重要性採樣與在策略上的限制

天真的策略梯度估計器需要從當前策略採樣軌跡,使其成為 on‑policy:在參數更新後,舊樣本無法重複使用。重要性採樣透過使用舊策略 π_old 的樣本並按照比率 π_θ(a|s) / π_old(a|s) 重新加權來修正這一點。在實際應用中,只有比率的動作部分是可計算的,這導致了一種估計器,它在狀態上使用舊策略,但透過比率來校正動作分布。

鄰近策略優化(PPO)剪裁規則

PPO 透過剪裁概率比率來修改代理目標,以防止過大的更新。對於給定的優勢 Â_t:

  • 如果 Â_t > 0 且比率 r_t = π_θ(a_t|s_t) / π_old(a_t|s_t) 高於 1 + ε_high,則貢獻被剪裁為 (1 + ε_high) Â_t,導致梯度為零。
  • 如果 Â_t > 0 且 r_t 低於剪裁閾值,則該項為 r_t Â_t,並進行梯度更新。
  • 如果 Â_t < 0 且 r_t 低於 1 − ε_low,則貢獻被剪裁為 (1 − ε_low) Â_t,同樣得到零梯度。
  • 如果 Â_t < 0 且 r_t 高於下限閾值,則該項為 r_t Â_t,並進行梯度更新。 講座中提到的典型值為 ε_high ≈ 0.28 與 ε_low ≈ 0.2。剪裁實現了這樣的想法:當新策略已經足夠好或足夠壞於舊策略時,不需要進一步更新。

PPO 的變體(GRPO 與 SIPO)

講座描述了基本 PPO 方案的兩種擴展。

  • GRPO(被稱為「PO 的進階版本」)應用相同的剪裁邏輯,但當比率超過上限閾值時,它將貢獻設為零,而不是保持一個常數剪裁值。
  • SIPO(在逐字稿中稱為「SIS pole」)的區別在於當比率較大時,它保持非零的常數梯度:它將比率剪裁為 1,而不是將該項歸零,從而在仍然限制幅度的同時保留一些學習信號。 這兩種變體旨在平衡穩定性與學習速度,SIPO 在高比率 regime 中保留更多的梯度信號。

將強化學習應用於大型語言模型以進行鏈式思考

要訓練語言模型產生鏈式思考推理,將生成過程視為馬可夫決策過程,其中狀態是提示與先前生成的標記的連接,動作是下一個標記,轉移是確定性的(追加所選標記)。獎勵僅在軌跡結束時給出,並基於最終答案是否匹配真實解;中間思考標記不會直接獲得獎勵。這種設置允許使用任何策略梯度方法,包括 PPO 或其變體,來優化模型以得到正確答案,同時鼓勵多步推理。

大型語言模型訓練中的獎勵設計與基線

因為獎勵是二元的(正確答案為 1,否則為 0),方差可能很高。一種常見的基線是對同一提示的多個採樣軌跡取平均獎勵:計算八次 rollout 的獎勵 R₁…R₈,取其平均 R̄,然後從每個個別獎勵中減去 R̄ 以獲得優勢估計。這個基線僅依賴於提示(狀態),因此滿足減去它不會改變預期梯度的條件。額外的正規化(例如,除以標準差)可以被應用,但講座指出這僅為進一步研究的選項。

Sources