OpenAI 机器人研究的要素

OpenAI 已发布八个模拟机器人环境和一个 Baselines 实现的后经验重播 (HER)。这些工具旨在促进可迁移到物理机器人的模型训练,特别针对比现有 MuJoCo 连续控制环境更具挑战性的操作任务。

模拟机器人环境

OpenAI 使用 MuJoCo 物理模拟器为 Gym 提供了八个新环境,分属两个机器人平台:

Fetch 研究平台

  • FetchReach-v0:机器人必须将其末端执行器移动到特定目标位置。
  • FetchSlide-v0:机器人必须击打桌子上的冰球,使其滑动并停在期望的目标位置。
  • FetchPush-v0:机器人必须推动一个箱子,直到它到达期望的目标位置。
  • FetchPickAndPlace-v0:机器人必须从桌子上拿起一个箱子并将其移动到桌子上方的目标位置。

ShadowHand 机器人

  • HandReach-v0:机器人必须使用其拇指和一个选定的手指在手掌上方的目标位置处会合。
  • HandManipulateBlock-v0:机器人必须操作一个块以达到期望的位置和旋转。
  • HandManipulateEgg-v0:机器人必须操作一个蛋以达到期望的位置和旋转。
  • HandManipulatePen-v0:机器人必须操作一支笔以达到期望的位置和旋转。

基于目标的学习和稀疏奖励

所有新环境都引入了一个“目标”概念,例如目标位置或方向。默认情况下,这些环境使用稀疏奖励:如果目标达成(在容忍范围内)则奖励为 0,否则为 -1。虽然存在密集奖励变体,但 OpenAI 鼓励使用稀疏奖励,因为它们在实际机器人应用中更为真实。

后经验重播 (HER)

为了解决从稀疏奖励学习的困难——代理可能在多次尝试中持续收到 -1 信号——OpenAI 发布了一个 Baselines 实现的后经验重播 (HER)。

HER 通过将原始目标替换为在一个回合中实际达到的目标,使代理能够从失败中学习。通过假装达到的状态就是预期的目标,即使代理未能完成主要任务,它也会获得正向学习信号。随着时间的推移,这使得代理能够学习如何实现任意目标,包括原始目标。

HER 是一种离策略强化学习算法,可以与其他离策略方法结合使用,例如深度确定性策略梯度 (DDPG)。在测试中,DDPG + HER 与稀疏奖励的组合在诸如 HandManipulateBlockRotateXYZ-v0 这样的具有挑战性的任务上显著优于原始 DDPG,甚至优于 DDPG + HER 与密集奖励的组合。

HER 的未来研究方向

OpenAI 确定了若干改进 HER 以及一般强化学习的领域:

  • 自动目标创建:学习选择后经验目标的策略,而不是使用硬编码方法。
  • 无偏 HER:利用重要性采样推导出无偏的 HER 版本,以防止目标替换可能导致的不稳定性。
  • HER + HRL:将 HER 与分层强化学习 (HRL) 结合,以将后经验应用于由更高级策略生成的动作。
  • 更丰富的价值函数:将价值函数条件化于额外输入,如成功阈值或折扣因子。
  • 更快的信息传播:研究目标网络的替代方案,以在不牺牲稳定性的情况下加速训练。
  • HER + 多步回报:尽管目标替换具有离策略性质,寻找使用多步回报的方法。
  • On-policy HER:通过重要性采样探索将 HER 与像 PPO 这样的稳定 on-policy 算法结合。
  • 样本效率:设计算法,即使在动作频率趋于无穷大时也能保持性能。
  • 集成:将 HER 与诸如优先经验回放、分布式 RL 或熵正则化 RL 等进展相结合。

面向基于目标环境的 Gym API 更改

为了支持这些环境,Gym API 进行了以下更改:

  • 观察空间:基于目标的环境现在使用 gym.spaces.Dict 观察空间,包含 desired_goalachieved_goalobservation(机器人的状态)。
  • 奖励函数暴露:环境的奖励函数现在被暴露,允许算法根据替换的目标重新计算奖励。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch