通过学习深度逆动力学模型将仿真迁移到真实世界 – OpenAI 2016

TL;DR

OpenAI 提出了一种技术,用于将在仿真中学习的控制策略迁移到真实世界的机器人。在每个时间步,该方法使用仿真策略预测下一个状态,然后查询已学习的深度逆动力学模型,以选择能够产生该状态的真实世界动作,从而绕过了对准确动力学参数的需求。

方法概述

该方法首先运行在仿真中训练得到的控制策略。它不在真实机器人上直接执行策略的原始控制信号,而是计算在应用该信号后仿真所期望的状态。然后,基于真实世界数据训练的深度逆动力学模型确定哪种真实世界动作最有可能实现该期望的下一个状态。这个逆模型替换了导致仿真‑真实差距的缺失或不准确的动力学项(例如,摩擦、接触、质量、几何)。

逆动力学模型的数据收集

为了训练深度逆动力学模型,作者提出了一种增量数据收集过程。机器人执行探索性动作,记录由此产生的状态转移,并使用这些(动作,结果状态)对来监督模型。随着收集的数据越来越多,模型的预测会得到改进,从而使迁移方法能够随着时间的推移不断优化其动作选择。

实验比较

作者将他们的方法与几个旨在处理仿真‑真实世界差异的基线进行了评估,包括输出误差控制和高斯动力学适应。实验表明,深度逆动力学方法相比这些基线表现更好,表明从真实数据学习逆模型可以有效地弥合差距,而无需显式的系统辨识。

含义

通过将策略学习与准确的动力学建模解耦,该技术使得在硬件部署之前,在仿真中开发复杂机器人行为变得更安全、更实用。它还突出了一种通用策略:从真实交互中学逆动力学模型,并利用它将仿真计划转化为真实世界的动作,这一原则可以应用于各种机器人平台和学习算法。

Sources