Hugging Face 深度强化学习课程 第2单元 第1部分:Q学习概念简介
TL;DR
Hugging Face 发布了其深度强化学习课程的第一期,涵盖了基于价值方法的理论、贝尔曼方程以及 Monte‑Carlo 与 Temporal‑Difference 学习的区别,这些都是即将到来的 Q‑Learning 教程的关键基础。
什么是强化学习? – 核心理念
强化学习(Reinforcement Learning,RL)通过让 agent 与环境交互、接收 rewards 作为反馈,并旨在 maximize expected cumulative reward,来训练其进行序列决策。决策规则称为 policy (π),它将每个观察到的状态映射到一个动作(或动作的概率分布)。最终目标是发现 optimal policy π*,即能够产生最高期望回报的策略。
存在两大类 RL 方法:
- Policy‑based methods:直接优化策略参数。
- Value‑based methods:学习一个 value function,用于估计状态(或状态‑动作对)的好坏,然后从该函数导出策略(通常是贪婪或 ε‑greedy 策略)。
本文聚焦于 value‑based 方面。
两类基于价值的函数
状态价值函数 (V)
在策略 π 下的状态价值函数定义为:
( V^{\pi}(s) = \mathbb{E}{\pi}\big[ \sum{k=0}^{\infty} \gamma^{k} R_{t+k+1} \mid S_t = s \big] )
它给出当 agent starts in state s 并随后遵循 π 时的期望折扣回报。
动作价值函数 (Q)
动作价值函数将 V 扩展到状态‑动作对:
( Q^{\pi}(s, a) = \mathbb{E}{\pi}\big[ \sum{k=0}^{\infty} \gamma^{k} R_{t+k+1} \mid S_t = s, A_t = a \big] )
它衡量当 agent starts in state s,采取动作 a,随后遵循 π 时的期望回报。
两者最终都表示 expected returns,但 Q 提供了在基于价值的算法中进行 greedy action selection 所需的细粒度。
贝尔曼方程 – 递归价值估计
通过枚举所有可能的未来轨迹来计算 V 或 Q 是不可行的。Bellman equation 提供了一种递归的替代方法:
( V^{\pi}(s) = R_{t+1} + \gamma ; V^{\pi}(s') )
其中 (s') 是在执行 π 所规定的动作后得到的下一个状态。对于 Q 值,递归形式为:
( Q^{\pi}(s, a) = R_{t+1} + \gamma ; \mathbb{E}{s'}\big[ \max{a'} Q^{\pi}(s', a') \big] )
在本文的简化示例中,折扣因子 (\gamma) 被设为 1,因此贝尔曼更新简化为 immediate reward + value of the next state。这种递归是 Monte‑Carlo 与 Temporal‑Difference 学习的基础。
Monte‑Carlo 与 Temporal‑Difference (TD) 学习
两种方法都利用经验来更新价值估计,但它们在 when 和 how 更新上有所不同。
Monte‑Carlo (MC) 学习
When? 在整个回合结束后。
How? 计算每个访问状态的 return (G_t = \sum_{k=t}^{T} \gamma^{k-t} R_{k+1}),并将其作为目标:
( V(s) \leftarrow V(s) + \alpha \big[ G_t - V(s) \big] )
Pros:使用真实的折扣回报,没有引导产生的偏差。
Cons:需要完整的回合;方差大;信息传播较慢。
Temporal‑Difference (TD) 学习
When? 在每一步之后。
How? 使用即时奖励和下一个状态价值的当前估计构造 TD target:
( V(s) \leftarrow V(s) + \alpha \big[ R_{t+1} + \gamma V(s') - V(s) \big] )
Pros:在线更新,方差更低,学习更快。
Cons:会引入偏差,因为它依赖于当前对 (V(s')) 的估计(引导)。
本文使用一个简单的网格世界老鼠示例演示了两种方法,展示了学习率 (\alpha = 0.1) 和 (\gamma = 1) 下逐步计算更新的过程。
关键要点总结
- Value‑based RL 学习一个函数(V 或 Q)来预测期望回报;策略由该函数导出(例如 greedy 或 ε‑greedy)。
- State‑value (V) 评估状态;action‑value (Q) 评估状态‑动作对,从而实现直接动作选择。
- Bellman equation 提供了递归的表述,用一个简单的更新替代了穷尽求和:immediate reward + discounted next‑state value。
- Monte‑Carlo 在完整回合后使用真实回报进行更新;TD learning 在每一步后使用引导估计进行更新。
- 在深入研究 Q‑Learning(第一个在 Atari 游戏上达到人类水平的深度强化学习算法)之前,掌握这些概念至关重要。
课程后续步骤
文章宣布第二部分将覆盖 Q‑Learning,并在两个环境中提供实战实现:
- FrozenLake‑v1 (non‑slippery) – 从起点 (S) 导航到目标 (G),同时避开洞 (H)。
- Taxi‑v3 – 学习在网格城市中将乘客在各地点之间运输。
鼓励学生通过测验(帖子中链接)检验自己的理解,并通过 Google Form 提交反馈。
保持学习,保持出色!