斯坦福 CS229 第 18 讲(2026 春):强化学习与策略梯度入门
TL;DR
强化学习(RL)将顺序决策问题建模为马尔可夫决策过程(MDP),并从标量奖励而非监督标签中学习策略;本讲的核心贡献是推导了策略梯度(REINFORCE)算法,该算法使得可以通过对预期回报的梯度上升直接优化随机策略。
1. 为什么需要强化学习?
- 顺序决策:动作会影响未来状态,因此短视的贪婪选择可能是次优的。机器人导航示例(在一维线上向左/向右移动)说明每一步都会影响下一步。
- 探索与利用:强化学习必须在收集信息(探索)与利用当前知识以最大化奖励(利用)之间取得平衡。在实际应用中,许多系统依赖于算法固有的随机性,而不是显式的探索策略。
- 稀疏监督:与分类不同,强化学习仅提供一个标量 奖励 来表示轨迹的好坏;最优动作没有被标注。
- 数据收集循环:智能体生成动作,观察得到的状态和奖励,并更新其策略以强化良好动作并惩罚不良动作。
2. 马尔可夫决策过程(MDP)形式化
| 组件 | 符号 | 含义 |
|---|---|---|
| 状态空间 | (\mathcal{S}) | 环境的所有可能配置(例如,机器人关节角度、棋盘位置)。 |
| 动作空间 | (\mathcal{A}) | 可采取的动作集合(例如,关节力矩、围棋走法)。 |
| 转移动态 | (P(s'\mid s,a)) | 在状态 (s) 执行动作 (a) 后到达状态 (s') 的概率。可以是确定的或随机的。 |
| 奖励函数 | (r(s))(或 (r(s,a)),(r(s,a,s'))) | 标量反馈,表示状态(或状态‑动作对)的可取性。 |
| 折扣因子 | (\gamma\in[0,1)) | 权重因子,使即时奖励比远期奖励更重要;确保无限 horizon 下的回报有界。 |
- 轨迹(episode):通过反复从策略中采样动作并通过 (P) 进行状态转移生成的序列 ((s_0,a_0,s_1,a_1,\dots))。
- 回报:(G = \sum_{t=0}^{T}\gamma^{t} r(s_t))。在策略 (\pi) 下的期望回报记作 (J(\pi) = \mathbb{E}_{\pi}[G])。
- 策略:映射 (\pi: \mathcal{S}\rightarrow \Delta(\mathcal{A}))(确定性或随机性)。虽然总存在一个最优的确定性策略,但随机策略在探索和基于梯度的学习中很有用。
3. 价值函数和最优性
- 策略的状态价值:(V^{\pi}(s) = \mathbb{E}_{\pi}[G\mid s_0=s])。
- 最优价值:(V^{*}(s) = \max_{\pi} V^{\pi}(s))。
- 最优策略:(\pi^{*} = \arg\max_{\pi} V^{\pi}(s)),对所有 (s) 成立。
- 贝尔曼方程:提供递归关系,例如, [ V^{\pi}(s) = r(s) + \gamma \sum_{a}\pi(a\mid s) \sum_{s'} P(s'\mid s,a) V^{\pi}(s'). ] 求解这些线性方程可以得到小型离散 MDP 的精确值;对于大型或连续空间,我们则采用近似方法。
4. 奖励塑造
- 定义:修改奖励函数以提供更平滑的梯度,同时保持最优策略不变。
- 示例:不使用二元奖励(目标处为 (+1),其他地方为 (-0.1)),而是对更接近目标的状态赋予更高的奖励。这可以加速学习,但如果塑造未能反映真实的任务动态(例如,隐藏的传送捷径),可能会误导智能体。
- 警告:过度塑造可能会使学习到的策略偏离真实目标;设计者必须在信息量与忠实度之间取得平衡。
5. 策略梯度(REINFORCE)推导
- 随机策略参数化:(\pi_{\theta}(a\mid s)) 由一个神经网络表示,该网络为每个动作输出概率密度(或分类分布)。
- 目标:最大化期望回报 (J(\theta) = \mathbb{E}{\pi{\theta}}[G])。
- 梯度技巧:
[
\nabla_{\theta} J(\theta) = \mathbb{E}{\pi{\theta}}\big[ G ; \nabla_{\theta} \log \pi_{\theta}(a\mid s) \big].
]
- 通过将期望写成轨迹上的积分,然后应用恒等式 (\nabla_{\theta} p_{\theta}(x) = p_{\theta}(x) \nabla_{\theta} \log p_{\theta}(x)),可以将梯度移入期望内部。
- 实际估计器:采样一批轨迹,计算每条轨迹的回报 (G),然后使用上述估计器通过随机梯度上升更新 (\theta)。
- 方差减少:讲义指出基本的 REINFORCE 估计器可能具有高方差;常用技术(基线减法、优势估计)被提及但未详细说明。
- 无需转移模型:梯度表达式不需要知道 (P(s'\mid s,a));仅需采样的动作和奖励。
6. 从业者的关键要点
- 建立 MDP:识别状态、动作、转移动态(即使仅通过仿射隐式给出),以及能够捕捉真实目标的奖励。
- 选择随机策略:使得基于梯度的优化和自然探索成为可能。
- 使用策略梯度:REINFORCE 提供了一种简单的无模型方法来改进策略;它是用于大型语言模型微调的更高级算法的基础。
- 奖励塑造是可选但强大的:设计更平滑的奖励以帮助学习,但需要验证塑造不会改变最优解。
- 折扣因子很重要:(\gamma) 在短期奖励与长期奖励之间取得平衡,并保证无限 horizon 问题的回报有界。
7. 参考文献及进一步阅读
- Sutton, R. S., & Barto, A. G. (2018). Reinforcement Learning: An Introduction (2nd ed.). MIT Press.
- Williams, R. J. (1992). “Simple statistical gradient‑following algorithms for connectionist reinforcement learning.” Machine Learning, 8(3‑4), 229‑256. (Original REINFORCE paper.)
- CS229 Spring 2026 lecture notes (available on the course website) for detailed proofs of the Bellman equations and additional policy‑gradient variants.