OpenAI 后经验重放
OpenAI 提出了 Hindsight Experience Replay(HER),这是一种旨在克服稀疏奖励挑战的强化学习(RL)技术。通过让智能体从失败中学习,将其视为 unintended goals 的成功完成,HER 实现了样本高效的学习,而无需复杂的奖励工程。
解决稀疏奖励问题
在许多强化学习环境中,奖励是稀疏且二元的——这意味着智能体只有在任务完美完成时才会收到正向信号。这常常使得训练变得困难,因为智能体可能很少遇到奖励,因而几乎没有可学习的数据。
Hindsight Experience Replay 通过将每一次经历视为学习机会来解决这一问题。智能体不仅仅从目标实现的情节中学习,而是回顾其实际达到的状态,并将该状态视为该特定情节的预期目标。这一过程充当了一种隐式课程,使智能体在最终掌握主要目标之前,能够了解如何到达各种状态。
技术实现与兼容性
HER 设计为灵活且可与任意离线策略强化学习算法结合使用。由于它修改了经验在内存缓冲区中的存储和重放方式,因此无需更改核心 RL 算法本身。
机器人操作中的实验结果
OpenAI 通过让机械臂执行三种不同的操作任务来展示 HER 的有效性:
- 推送: 将物体移动到目标位置。
- 滑动: 在表面上移动物体。
- 抓取放置: 抬起并将物体移动到特定目的地。
在这些实验中,研究人员仅使用了二元奖励,用于指示任务是否完成。消融研究证实,Hindsight Experience Replay 是使在这些具有挑战性的环境中进行训练成为可能的关键因素。
仿真到真实的迁移
研究表明,在物理模拟中使用 HER 训练的策略可以成功部署到真实机器人上。智能体能够将在模拟中学习的技能迁移到真实世界,并成功完成任务,证明了该技术在合成环境之外的实际实用性。
Sources
- OriginalHindsight Experience Replay