シミュレーションから実世界への転移 ― ディープ逆動力学モデルの学習による – OpenAI 2016

TL;DR

OpenAIは、シミュレーションで学習された制御ポリシーを実世界のロボットに転移する技術を導入した。各タイムステップで、この方法はシミュレーションポリシーを使って次の状態を予測し、その後学習済みのディープ逆動力学モデルにクエリを送って、その状態を生み出す実世界の行動を選択する。これにより、正確な動力学パラメータが必要なくなる。

Method Overview

このアプローチはまず、シミュレーションで訓練された制御ポリシーを実行する。実ロボットでポリシーの生の制御信号を実行する代わりに、その信号を適用した後にシミュレーションが期待する状態を計算する。実世界のデータで訓練されたディープ逆動力学モデルは、その後、その期待される次の状態を達成する可能性が最も高い実世界の行動を決定する。この逆モデルは、シミュレーションと実世界のギャップを引き起こす欠落しているまたは不正確な動力学項(例えば、摩擦、接触、質量、形状)を置き換える。

Data Collection for the Inverse Dynamics Model

ディープ逆動力学モデルを訓練するため、著者たちは増分データ収集手順を提案する。ロボットは探索的な行動を実行し、その結果の状態遷移を記録し、これらのペア(行動、結果の状態)を使ってモデルを教師データとして使用する。より多くのデータが収集されるにつれて、モデルの予測精度が向上し、転移手法は時間とともに行動選択を洗練させることができる。

Experimental Comparison

著者たちは、出力誤差制御やガウス動力学適応など、シミュレーションと実世界の不一致に対処するために設計されたいくつかのベースラインと自分の手法を比較評価した。実験の結果、ディープ逆動力学アプローチはこれらのベースラインに対して有利であることが示され、実データから逆モデルを学習することで、明示的なシステム識別を行わずにギャップを効果的に縮小できることを示している。

Implications

ポリシー学習と正確な動力学モデリングを分離することにより、この技術はハードウェアに展開する前にシミュレーションで複雑なロボットの振る舞いを開発することをより安全かつ実用的にする。さらに、一般的な戦略を示している:実際の相互作用から逆動力学モデルを学習し、それを使ってシミュレーションの計画を実世界の行動に変換する。この原則は、さまざまなロボットプラットフォームや学習アルゴリズムに適用できる。

Sources