OpenAI ワンショット模倣学習

OpenAIは、ワンショット模倣学習のためのメタ学習フレームワークを開発し、ロボットが単一のデモンストレーションからタスクを学び、すぐにそのタスクの新しいインスタンスに一般化できるようにしました。このアプローチは、従来の模倣学習で通常必要とされる広範な特徴エンジニアリングや大規模なサンプルサイズの必要性をなくします。

汎化のためのメタ学習フレームワーク

ワンショット模倣学習は、学ぶ方法を学ぶためのメタ学習アプローチを利用します。特定のタスクを孤立して解くのではなく、モデルは複数のインスタンスを持つ大規模なタスクセットで訓練されます。たとえば、タスクはブロックを1つの塔に積み上げるか、2ブロックの塔に配置することがあります。タスクの各インスタンスは、異なる初期状態と異なるブロックのセットを含みます。

トレーニングプロセス

トレーニング中、アルゴリズムはデモンストレーションのペアを提示されます。ニューラルネットワークは、2つの入力―1つのデモンストレーションとロボットの現在の状態―を取るように訓練されます。このプロセスで、モデルはペアの2番目のデモンストレーションからの状態とアクションのシーケンスに一致させようとします。目的は、2番目のデモンストレーションにできるだけ近い状態とアクションのシーケンスをもたらすアクションを出力することです。

テスト時のパフォーマンス

テスト時、モデルは新しいタスクの単一インスタンスのデモンストレーションを提示されます。その後、ニューラルネットワークはその新しいタスクの新たかつ見たことのないインスタンスでタスクを実行することが期待されます。この機能により、ロボットはランタイムで提供される別のデモンストレーションに基づいて、これまで見たことのない新しいタスクを実行できるようになります。

技術的実装とスケーラビリティ

システムはソフトアテンションメカニズムを使用し、トレーニングデータに存在しなかった条件やタスクに一般化できるようにモデルを許可します。これにより、モデルはより広範なタスクと設定に対応できるようになります。

OpenAIの研究者は、モデルをより多様なタスクと設定で訓練することにより、最終的にどんなデモンストレーションも頑健なポリシーに変換し、圧倒的な多様性のタスクを達成できる一般的なシステムになると予測しています。

Sources