OpenAI 非对称演员-评论家用于基于图像的机器人学习
OpenAI 已经开发了一种用于基于图像的机器人学习的非对称演员-评论家框架,使机器人能够在仿真中学习复杂任务,并将这些技能迁移到真实世界,而不需要任何真实世界的训练数据。这种方法利用物理仿真器的完全状态可观测性来训练一个更准确的评论家,而演员(策略)仅限于与其在真实世界中将遇到的相同部分观测(RGBD 图像)。
非对称演员-评论家架构
非对称演员-评论家方法的核心创新在于在训练过程中解耦演员和评论家可获得的信息。在传统的演员-评论家强化学习中,两个组件通常共享相同的观测空间。在这种非对称方法中:
- 评论家: 使用物理仿真器提供的完全状态可观测性进行训练。这使得评论家能够对环境的真实状态有精确的理解,模拟一种“特权”的特权信息流。
- 演员(策略): 仅接收渲染的 RGBD 图像作为输入。这确保了演员学习基于其在真实世界部署过程中将使用的深度和颜色相同的视觉观测进行操作。
通过向评论家提供完整的状态信息,该算法可以更有效地指导演员的学习过程,从而在仿真中提高学习过程的整体性能和稳定性。
仿真到真实世界迁移
为了弥合仿真环境与物理世界之间的差距,OpenAI 将非对称演员-评论家方法与域随机化相结合。域随机化涉及在仿真中改变环境的物理属性和视觉外观,以确保策略对真实世界与仿真之间的视觉和物理差异具有鲁棒性。
OpenAI 研究人员展示了将仅在仿真中训练的策略成功迁移到物理机器人。机器人完成了包括以下几项任务:
- 抓起一个积木
- 推动一个积木
- 将一个积木推到特定位置
- 移动一个积木
这些任务是在没有任何真实世界数据训练的情况下完成的,这是在降低在物理硬件上训练强化学习代理的成本和危险方面的重要里程碑。
对机器人学习的影响
此研究表明,利用仿真的完全状态可观测性进行非对称演员-评论家训练可以实现更高效、更鲁棒的机器人学习。通过将演员的输入空间与观测序列分离,演员可以学习基于高保真评论家的手动指导将视觉输入映射到动作,同时在真实世界部署中保持兼容,因为在真实世界部署中完全状态信息不可用。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch