Stanford CS229 第 18 課 (2026 春季):強化學習與政策梯度入門

TL;DR

強化學習(RL)將序列決策問題建模為馬可夫決策過程(MDP),並從純量獎勵而非監督標籤中學習政策;本講的核心貢獻是政策梯度(REINFORCE)算法的推導,該算法使得隨機政策能夠直接透過對預期回報的梯度上升進行優化。

1. 為什麼要使用強化學習?

  • 序列決策:行動會影響未來狀態,因此近視的貪婪選擇可能是次優的。機器人導航範例(在一維線上向左/右移動)說明每一步都會影響下一步。
  • 探索 vs. 利用:RL 必須在收集資訊(探索)與利用現有知識以最大化獎勵(利用)之間取得平衡。在實踐中,許多應用依賴演算法固有的隨機性,而非顯式的探索策略。
  • 稀疏監督:與分類不同,RL 僅提供一個純量 reward 來指示軌跡的好壞;最佳動作並未被標註。
  • 資料收集迴圈:代理產生動作,觀察結果狀態和獎勵,並更新其政策以加強良好動作並懲罰不良動作。

2. 馬可夫決策過程(MDP)形式化

Component Symbol Meaning
狀態空間 (\mathcal{S}) 環境的所有可能配置(例如,機器人關節角度、棋盤位置)。
動作空間 (\mathcal{A}) 可執行動作的集合(例如,關節扭矩、圍棋走法)。
轉移動態 (P(s'\mid s,a)) 在狀態 (s) 下執行動作 (a) 後達到狀態 (s') 的概率。可以是確定的或隨機的。
獎勵函數 (r(s)) (或 (r(s,a))、(r(s,a,s'))) 指示狀態(或狀態‑動作對)的期望度的純量回饋。
折扣因子 (\gamma\in[0,1)) 對即時獎勵給予比遠期獎勵更大的權重;確保無限 horizon 的回報有界。
  • 軌跡(episode):透過反覆從政策中採樣動作並經由 (P) 轉移所生成的序列 ((s_0,a_0,s_1,a_1,\dots))。
  • 回報:(G = \sum_{t=0}^{T}\gamma^{t} r(s_t))。在政策 (\pi) 下的預期回報記為 (J(\pi) = \mathbb{E}_{\pi}[G])。
  • 政策:映射 (\pi: \mathcal{S}\rightarrow \Delta(\mathcal{A}))(確定性或隨機性)。最佳確定性政策總是存在,但隨機政策對探索和基於梯度的學習很有用。

3. 價值函數與最佳性

  • 政策的狀態價值:(V^{\pi}(s) = \mathbb{E}_{\pi}[G\mid s_0=s])。
  • 最佳價值:(V^{*}(s) = \max_{\pi} V^{\pi}(s))。
  • 最佳政策:(\pi^{*} = \arg\max_{\pi} V^{\pi}(s)),對所有 (s) 成立。
  • 貝爾曼方程:提供遞迴關係,例如, [ V^{\pi}(s) = r(s) + \gamma \sum_{a}\pi(a\mid s) \sum_{s'} P(s'\mid s,a) V^{\pi}(s').\n ] 求解這些線性方程可得到小型離散 MDP 的精確值;對於大型或連續空間,我們則求助於近似方法。

4. 獎勵塑造

  • 定義:修改獎勵函數以提供更平滑的梯度,同時保持最佳政策不變。
  • 範例:不使用二元獎勵(目標處為 (+1),其他處為 (-0.1)),而是對離目標更近的狀態給予更高的獎勵。這可以加速學習,但如果塑造未能反映真實的任務動態(例如,隱藏的傳送捷徑),則可能誤導代理。
  • 注意:過度塑造可能會使學習到的政策偏離真實目標;設計者必須在資訊量與忠實度之間取得平衡。

5. 政策梯度(REINFORCE)推導

  1. 隨機政策參數化:(\pi_{\theta}(a\mid s)) 由一個神經網路表示,該網路為每個動作輸出機率密度(或類別分布)。
  2. 目標:最大化預期回報 (J(\theta) = \mathbb{E}{\pi{\theta}}[G])。
  3. 梯度技巧: [ \nabla_{\theta} J(\theta) = \mathbb{E}{\pi{\theta}}\big[ G ; \nabla_{\theta} \log \pi_{\theta}(a\mid s) \big].\n ]
    • 該推導透過將期望寫成軌跡上的積分,然後應用身份 (\nabla_{\theta} p_{\theta}(x) = p_{\theta}(p_{\theta}(x) = p_{\theta}(x) \nabla_{\theta} \log p_{\theta}(x)) 來將梯度移入期望內部。
  4. 實用估計器:抽取一批軌跡,計算每條軌跡的回報 (G),然後使用上述估計器經由隨機梯度上升更新 (\theta)。
  5. 變異數減少:講義指出基本的 REINFORCE 估計器可能具有高變異數;常見技巧(基線減法、優勢估計)被提及但未詳細說明。
  6. 無需轉移模型:梯度表達式不需要知道 (P(s'\mid s,a));僅需要採樣到的動作和獎勵。

6. 從業者的關鍵要點

  • 建模 MDP:識別狀態、動作、轉移動態(即使僅透過模擬隱含),以及能夠捕捉真實目標的獎勵。
  • 選擇隨機政策:使得基於梯度的優化和自然探索成為可能。
  • 使用政策梯度:REINFORCE 提供了一種簡單且無需模型的方法來改進政策;它是用於大型語言模型微調的更進階算法的基礎。
  • 獎勵塑造是可選但強大的:設計更平滑的獎勵以助學習,但請確認塑造不會改變最佳解。
  • 折扣因子很重要:(\gamma) 平衡短期與長期獎勵,並保證無限 horizon 問題的回報有界。

7. 參考文獻與進一步閱讀

  • Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press.
  • Williams, R. J. (1992). “Simple statistical gradient‑following algorithms for connectionist reinforcement learning.” Machine Learning, 8(3‑4), 229‑256. (Original REINFORCE paper.)
  • CS229 2026 春季講義(可在課程網站上取得)提供貝爾曼方程的詳細證明以及其他政策梯度變體。

Sources