Hugging Face 深度强化学习课程 第2单元 第1部分:Q学习概念简介

TL;DR

Hugging Face 发布了其深度强化学习课程的第一期,涵盖了基于价值方法的理论、贝尔曼方程以及 Monte‑Carlo 与 Temporal‑Difference 学习的区别,这些都是即将到来的 Q‑Learning 教程的关键基础。


什么是强化学习? – 核心理念

强化学习(Reinforcement Learning,RL)通过让 agent 与环境交互、接收 rewards 作为反馈,并旨在 maximize expected cumulative reward,来训练其进行序列决策。决策规则称为 policy (π),它将每个观察到的状态映射到一个动作(或动作的概率分布)。最终目标是发现 optimal policy π*,即能够产生最高期望回报的策略。

存在两大类 RL 方法:

  • Policy‑based methods:直接优化策略参数。
  • Value‑based methods:学习一个 value function,用于估计状态(或状态‑动作对)的好坏,然后从该函数导出策略(通常是贪婪或 ε‑greedy 策略)。

本文聚焦于 value‑based 方面。


两类基于价值的函数

状态价值函数 (V)

在策略 π 下的状态价值函数定义为:

( V^{\pi}(s) = \mathbb{E}{\pi}\big[ \sum{k=0}^{\infty} \gamma^{k} R_{t+k+1} \mid S_t = s \big] )

它给出当 agent starts in state s 并随后遵循 π 时的期望折扣回报。

动作价值函数 (Q)

动作价值函数将 V 扩展到状态‑动作对:

( Q^{\pi}(s, a) = \mathbb{E}{\pi}\big[ \sum{k=0}^{\infty} \gamma^{k} R_{t+k+1} \mid S_t = s, A_t = a \big] )

它衡量当 agent starts in state s,采取动作 a,随后遵循 π 时的期望回报。

两者最终都表示 expected returns,但 Q 提供了在基于价值的算法中进行 greedy action selection 所需的细粒度。


贝尔曼方程 – 递归价值估计

通过枚举所有可能的未来轨迹来计算 V 或 Q 是不可行的。Bellman equation 提供了一种递归的替代方法:

( V^{\pi}(s) = R_{t+1} + \gamma ; V^{\pi}(s') )

其中 (s') 是在执行 π 所规定的动作后得到的下一个状态。对于 Q 值,递归形式为:

( Q^{\pi}(s, a) = R_{t+1} + \gamma ; \mathbb{E}{s'}\big[ \max{a'} Q^{\pi}(s', a') \big] )

在本文的简化示例中,折扣因子 (\gamma) 被设为 1,因此贝尔曼更新简化为 immediate reward + value of the next state。这种递归是 Monte‑Carlo 与 Temporal‑Difference 学习的基础。


Monte‑Carlo 与 Temporal‑Difference (TD) 学习

两种方法都利用经验来更新价值估计,但它们在 whenhow 更新上有所不同。

Monte‑Carlo (MC) 学习

  • When? 在整个回合结束后。

  • How? 计算每个访问状态的 return (G_t = \sum_{k=t}^{T} \gamma^{k-t} R_{k+1}),并将其作为目标:

    ( V(s) \leftarrow V(s) + \alpha \big[ G_t - V(s) \big] )

  • Pros:使用真实的折扣回报,没有引导产生的偏差。

  • Cons:需要完整的回合;方差大;信息传播较慢。

Temporal‑Difference (TD) 学习

  • When? 在每一步之后。

  • How? 使用即时奖励和下一个状态价值的当前估计构造 TD target

    ( V(s) \leftarrow V(s) + \alpha \big[ R_{t+1} + \gamma V(s') - V(s) \big] )

  • Pros:在线更新,方差更低,学习更快。

  • Cons:会引入偏差,因为它依赖于当前对 (V(s')) 的估计(引导)。

本文使用一个简单的网格世界老鼠示例演示了两种方法,展示了学习率 (\alpha = 0.1) 和 (\gamma = 1) 下逐步计算更新的过程。


关键要点总结

  • Value‑based RL 学习一个函数(V 或 Q)来预测期望回报;策略由该函数导出(例如 greedy 或 ε‑greedy)。
  • State‑value (V) 评估状态;action‑value (Q) 评估状态‑动作对,从而实现直接动作选择。
  • Bellman equation 提供了递归的表述,用一个简单的更新替代了穷尽求和:immediate reward + discounted next‑state value
  • Monte‑Carlo 在完整回合后使用真实回报进行更新;TD learning 在每一步后使用引导估计进行更新。
  • 在深入研究 Q‑Learning(第一个在 Atari 游戏上达到人类水平的深度强化学习算法)之前,掌握这些概念至关重要。

课程后续步骤

文章宣布第二部分将覆盖 Q‑Learning,并在两个环境中提供实战实现:

  1. FrozenLake‑v1 (non‑slippery) – 从起点 (S) 导航到目标 (G),同时避开洞 (H)。
  2. Taxi‑v3 – 学习在网格城市中将乘客在各地点之间运输。

鼓励学生通过测验(帖子中链接)检验自己的理解,并通过 Google Form 提交反馈。

保持学习,保持出色!

Sources