OpenAI 第三者模倣学習

OpenAI は、異なる視点からのデモンストレーションを観察することで目標を達成できる無監督の第三者模倣学習手法を開発しました。このアプローチは、エージェントが取るべき正確な状態と行動のシーケンスを提供する必要がある第一者デモンストレーションの要件を取り除き、それによってデータ収集プロセスを簡素化します。

無監督の第三者模倣学習

第三者模倣学習の核となる目的は、教師が異なる視点から同じ目標を達成しているのを観察した後、エージェントが単純な環境でその目標を達成できるように訓練することです。このプロセスは「無監督」と定義されます。なぜなら、エージェントは教師の状態と学生自身の状態の間の直接的な対応関係を提供されないからです。

この方法は、従来の強化学習(RL)の主要な制限に対処します。RL ではエージェントは高度な目標を達成できますが、正確な報酬関数を指定するのはしばしば困難です。従来の模倣学習は、第一者デモンストレーションを使用することでこれを解決しますが、そのようなデータの収集は困難です。人間が他者を観察しタスクを推測する学習方法を模倣することで、この方法はエージェントが外部からの観察から学習できるようにします。

技術的アプローチ: ドメインに依存しない特徴

この方法の主要な技術的洞察は、ドメイン混同を適用してドメインに依存しない特徴を作成することです。これらの特徴はトレーニングプロセスにおいて重要であり、エージェントが教師の視点と自身の視点の間のギャップを埋め、デモンストレーションがどの視点から観察されたかに関わらず学習された行動が適用可能であることを保証します。

実験的検証

OpenAI は、3つの特定のドメインで無監督の第三者模倣学習アプローチを検証し、その有効性を示しました:

  • Pointmass ドメイン: シンプルなポイントベースの環境でのナビゲーション能力をテストします。
  • Reacher ドメイン: ターゲット位置に到達する能力をテストします。
  • 逆さ振り子: 垂直位置での振り子のバランス能力をテストします。

Sources