Hugging Face 深度强化学习简介

TL;DR

Hugging Face 推出了一个免费、从入门到专家级的深度强化学习(Deep RL)课程,教授强化学习的基础概念、数学框架、探索‑利用权衡、基于策略和基于价值的求解方法,以及深度神经网络的作用。


强化学习是什么

强化学习(RL)是一种计算范式,智能体通过试错交互在环境中学习行为,并收到标量奖励作为反馈。 智能体的目标是最大化期望的累计奖励(回报)。

大局观

RL 智能体反复观察状态、选择动作、获得奖励并转移到新状态。这个循环类似于人类和动物通过经验学习的方式。

正式定义

强化学习是一种通过让智能体在环境中进行试错交互并收到正负奖励作为唯一反馈来解决控制任务(决策问题)的框架。


强化学习框架

RL 框架由马尔可夫决策过程(MDP)构成,定义了状态、动作、奖励和转移动力学。 智能体的目标是学习一个能够最大化折扣回报的策略。

RL 过程

  1. 状态 (S₀) 从环境中被观察到。
  2. 智能体根据其策略选择 动作 (A₀)
  3. 环境转移到 下一个状态 (S₁) 并产生 奖励 (R₁)
  4. 循环重复,生成轨迹 (S₀, A₀, R₁, S₁, A₁, …)。

奖励假设

所有目标都可以表述为 最大化期望累计奖励;因此,最优行为就是产生最高回报的行为。

马尔可夫性质

在 MDP 中,在已知当前状态的条件下,未来与过去相互独立;智能体只需当前状态即可决定下一步动作。

状态 vs 观察

  • 状态:对环境的完整描述(例如,完整的棋盘)。
  • 观察:对状态的部分视图(例如,马里奥关卡中可见的那一段)。

动作空间

  • 离散:有限集合的动作(例如,平台游戏中的左/右/跳)。
  • 连续:无限集合的动作(例如,自动驾驶汽车的转向角度)。

奖励与折扣

折扣回报为 (G_t = \sum_{k=0}^{\infty} \gamma^k R_{t+k+1}),其中 (\gamma \in [0,1]) 控制即时奖励与未来奖励之间的权衡。较大的 (\gamma) 使智能体更关注长期结果。

任务类型

  • episodic 任务 有起始状态和终止状态(例如,一个马里奥关卡)。
  • continuing 任务 无限运行且没有终止状态(例如,算法化的股票交易)。

探索 vs 利用

在探索(尝试未知动作)和利用(使用已知高奖励动作)之间取得平衡是发现最优策略的关键。 纯粹利用会使智能体陷入次优局部最大值,而过度探索则会浪费资源。


解决 RL 问题的主要方法

两大类算法旨在找到最优策略 (\pi^*):

基于策略的方法

  • 直接学习 策略函数 (\pi(a|s)),将状态映射到动作(确定性)或动作的概率分布(随机)。
  • 学到的策略即为智能体的“大脑”。

基于价值的方法

  • 学习 价值函数 (V(s)) 或动作价值函数 (Q(s,a)),估计从某状态(或状态‑动作对)出发的期望折扣回报。
  • 通过选择使估计价值最大的动作间接得到策略。

深度强化学习中的 “Deep”

深度 RL 将经典 RL 算法与深度神经网络结合,用于近似策略或价值函数,从而能够扩展到高维状态空间(如原始像素)。 例如,Deep Q‑Learning 用神经网络取代表格 Q‑矩阵来预测 Q 值。


课程安排与资源

  • 本教程是 Hugging Face Deep RL 课程的第 1 单元,是一套免费、开源的教材,内容从理论到实战项目循序渐进。
  • 学员将使用流行库 Stable Baselines3、RL Baselines3 Zoo、RLlib
  • 示例环境包括 SnowballFight、Huggy the Doggo、Space Invaders、PyBullet、LunarLander
  • 训练好的智能体可以 通过一条命令发布到 Hugging Face Hub,社区也提供了可直接下载的智能体。
  • 课程包含 挑战、测验以及分享自定义 Unity 或 Godot 环境的指南

后续步骤

下一单元将深入 Q‑Learning 与基于价值的方法,对比经典的表格方法和深度神经网络近似。


“强化学习是一种通过行动学习的计算方法。我们构建一个智能体,通过与环境的试错交互并收到奖励(正向或负向)作为反馈来学习。” – Hugging Face 深度 RL 简介

Sources