斯坦福 CS229 第 18 讲(2026 春):强化学习与策略梯度入门

TL;DR

强化学习(RL)将顺序决策问题建模为马尔可夫决策过程(MDP),并从标量奖励而非监督标签中学习策略;本讲的核心贡献是推导了策略梯度(REINFORCE)算法,该算法使得可以通过对预期回报的梯度上升直接优化随机策略。

1. 为什么需要强化学习?

  • 顺序决策:动作会影响未来状态,因此短视的贪婪选择可能是次优的。机器人导航示例(在一维线上向左/向右移动)说明每一步都会影响下一步。
  • 探索与利用:强化学习必须在收集信息(探索)与利用当前知识以最大化奖励(利用)之间取得平衡。在实际应用中,许多系统依赖于算法固有的随机性,而不是显式的探索策略。
  • 稀疏监督:与分类不同,强化学习仅提供一个标量 奖励 来表示轨迹的好坏;最优动作没有被标注。
  • 数据收集循环:智能体生成动作,观察得到的状态和奖励,并更新其策略以强化良好动作并惩罚不良动作。

2. 马尔可夫决策过程(MDP)形式化

组件 符号 含义
状态空间 (\mathcal{S}) 环境的所有可能配置(例如,机器人关节角度、棋盘位置)。
动作空间 (\mathcal{A}) 可采取的动作集合(例如,关节力矩、围棋走法)。
转移动态 (P(s'\mid s,a)) 在状态 (s) 执行动作 (a) 后到达状态 (s') 的概率。可以是确定的或随机的。
奖励函数 (r(s))(或 (r(s,a)),(r(s,a,s'))) 标量反馈,表示状态(或状态‑动作对)的可取性。
折扣因子 (\gamma\in[0,1)) 权重因子,使即时奖励比远期奖励更重要;确保无限 horizon 下的回报有界。
  • 轨迹(episode):通过反复从策略中采样动作并通过 (P) 进行状态转移生成的序列 ((s_0,a_0,s_1,a_1,\dots))。
  • 回报:(G = \sum_{t=0}^{T}\gamma^{t} r(s_t))。在策略 (\pi) 下的期望回报记作 (J(\pi) = \mathbb{E}_{\pi}[G])。
  • 策略:映射 (\pi: \mathcal{S}\rightarrow \Delta(\mathcal{A}))(确定性或随机性)。虽然总存在一个最优的确定性策略,但随机策略在探索和基于梯度的学习中很有用。

3. 价值函数和最优性

  • 策略的状态价值:(V^{\pi}(s) = \mathbb{E}_{\pi}[G\mid s_0=s])。
  • 最优价值:(V^{*}(s) = \max_{\pi} V^{\pi}(s))。
  • 最优策略:(\pi^{*} = \arg\max_{\pi} V^{\pi}(s)),对所有 (s) 成立。
  • 贝尔曼方程:提供递归关系,例如, [ V^{\pi}(s) = r(s) + \gamma \sum_{a}\pi(a\mid s) \sum_{s'} P(s'\mid s,a) V^{\pi}(s'). ] 求解这些线性方程可以得到小型离散 MDP 的精确值;对于大型或连续空间,我们则采用近似方法。

4. 奖励塑造

  • 定义:修改奖励函数以提供更平滑的梯度,同时保持最优策略不变。
  • 示例:不使用二元奖励(目标处为 (+1),其他地方为 (-0.1)),而是对更接近目标的状态赋予更高的奖励。这可以加速学习,但如果塑造未能反映真实的任务动态(例如,隐藏的传送捷径),可能会误导智能体。
  • 警告:过度塑造可能会使学习到的策略偏离真实目标;设计者必须在信息量与忠实度之间取得平衡。

5. 策略梯度(REINFORCE)推导

  1. 随机策略参数化:(\pi_{\theta}(a\mid s)) 由一个神经网络表示,该网络为每个动作输出概率密度(或分类分布)。
  2. 目标:最大化期望回报 (J(\theta) = \mathbb{E}{\pi{\theta}}[G])。
  3. 梯度技巧: [ \nabla_{\theta} J(\theta) = \mathbb{E}{\pi{\theta}}\big[ G ; \nabla_{\theta} \log \pi_{\theta}(a\mid s) \big]. ]
    • 通过将期望写成轨迹上的积分,然后应用恒等式 (\nabla_{\theta} p_{\theta}(x) = p_{\theta}(x) \nabla_{\theta} \log p_{\theta}(x)),可以将梯度移入期望内部。
  4. 实际估计器:采样一批轨迹,计算每条轨迹的回报 (G),然后使用上述估计器通过随机梯度上升更新 (\theta)。
  5. 方差减少:讲义指出基本的 REINFORCE 估计器可能具有高方差;常用技术(基线减法、优势估计)被提及但未详细说明。
  6. 无需转移模型:梯度表达式不需要知道 (P(s'\mid s,a));仅需采样的动作和奖励。

6. 从业者的关键要点

  • 建立 MDP:识别状态、动作、转移动态(即使仅通过仿射隐式给出),以及能够捕捉真实目标的奖励。
  • 选择随机策略:使得基于梯度的优化和自然探索成为可能。
  • 使用策略梯度:REINFORCE 提供了一种简单的无模型方法来改进策略;它是用于大型语言模型微调的更高级算法的基础。
  • 奖励塑造是可选但强大的:设计更平滑的奖励以帮助学习,但需要验证塑造不会改变最优解。
  • 折扣因子很重要:(\gamma) 在短期奖励与长期奖励之间取得平衡,并保证无限 horizon 问题的回报有界。

7. 参考文献及进一步阅读

  • Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press.
  • Williams, R. J. (1992). “Simple statistical gradient‑following algorithms for connectionist reinforcement learning.” Machine Learning, 8(3‑4), 229‑256. (Original REINFORCE paper.)
  • CS229 Spring 2026 lecture notes (available on the course website) for detailed proofs of the Bellman equations and additional policy‑gradient variants.

Sources