OpenAI 从仿真中泛化
OpenAI 已开发出机器人技术,使得完全在仿真中训练的机器人控制器可以部署到真实机器人上,并对未计划的环境变化做出反应。这一转变使得可以创建闭环系统,以适应真实世界的动态,而无需要求仿真完美匹配物理世界。
用于环境适应的动态随机化
动态随机化通过在广泛的仿真条件下训练机器人,使其能够适应未知的真实世界动态。OpenAI 在训练过程中随机化了九十五种不同的属性,而不是试图创建现实的完美副本,包括:
- 机器人身体每个连杆的质量。
- 目标对象的摩擦和阻尼。
- 支撑对象的桌子高度。
- 动作之间的延迟。
- 观测噪声。
为了实现这一点,OpenAI 使用了基于 LSTM 的策略来训练机器人推冰球。虽然标准的前馈网络在此任务上失败了,但 LSTM 成功了,因为它们可以利用过去的观察来分析世界动态并实时调整行为。
端到端视觉到动作学习
OpenAI 使用强化学习(RL)在仿真中成功地端到端训练了一个机器人,以直接将视觉映射到动作。该系统无需特殊传感器即可运行,并基于视觉反馈进行适应。
使用 Hindsight Experience Replay (HER) 克服稀疏奖励
传统的 RL 算法在拾取和放置任务上常常遇到困难,因为它们需要密集奖励(详细的逐步评分)才能发挥作用。为了解决这个问题,OpenAI 开发了 Hindsight Experience Replay (HER),这使得代理能够从二元奖励中学习。HER 允许代理将失败视为达到非预期状态的成功尝试,从而无论主要目标是否实现,都能从每次交互中学习。
非对称 Actor-Critic 架构
HER 的实现使用了具有非对称信息的 actor-critic 技术来弥合仿真与现实之间的差距:
- 评论家(Critic): 可以访问仿真的完整状态,以提供完全准确的反馈并估计 Q 值(未来奖励之和)。
- 演员(Actor): 仅能访问 RGB 和深度数据,确保策略仅依赖于物理世界中可用的数据。
为了确保视觉系统在真实世界中足够健壮,OpenAI 还对视觉形状应用了域随机化。
计算成本和战略展望
实施这些随机化技术会增加训练的计算开销。动态随机化会使训练速度降低 3 倍,而基于图像而不是状态的学习会慢 5–10 倍。
OpenAI 确定了构建通用机器人的三条主要路径:
- 在大量真实机器人舰队上进行训练。
- 提高仿真器的保真度以匹配真实世界。
- 随机化仿真器以使模型能够泛化到真实世界。
OpenAI 表示,他们越来越相信第三种方法——用于泛化的随机化——将是解决方案中最关键的组成部分。
Sources
- OriginalGeneralizing from simulation
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch