OpenAI マルチエージェント相互作用から生じるツール使用の発現
マルチエージェント競争がツール使用の発現を促進
OpenAIは、シミュレートされた隠れんぼ環境でのマルチエージェント共適応を通じて、エージェントが段階的に複雑なツール使用と戦略を発見できることを実証しました。ハイドラーが視線を避けようとし、シーカーがそれを維持しようとする競争的な設定でエージェントを訓練することにより、エージェントは6つの異なる戦略と対戦略のシリーズを開発しました。この発現的な複雑さは、オブジェクトとの相互作用に対する明示的なインセンティブなしに起こり、マルチエージェント競争が自己教師ありの方法で知能ある行動を生み出す可能性を示唆しています。
隠れんぼ環境
エージェントは次の機能と制約を持つ物理ベースのシミュレーションで動作します:
- 移動: エージェントはxおよびy方向に力を加えて移動し、z軸周りで回転します。
- 視覚: エージェントは視線の前方コーン内のオブジェクトを見ます。
- センシング: ライダーに似たセンサーは、近くの壁、オブジェクト、および他のエージェントへの距離データを提供します。
- オブジェクト相互作用: エージェントはオブジェクトをつかみ、移動し、ロックすることができます。オブジェクトをロックしたチームのみがそれをロック解除できます。
- ゲーム構造: ゲームには、シーカーが immobilized (動けなく) される準備フェーズがあり、これによりハイドラーは環境をセットアップできます。
報酬構造: 報酬はチームベースです。ハイドラーは全員が隠れている場合+1、いずれかが見つかった場合-1を受け取ります。シーカーはその逆の報酬(ハイドラー全員が隠れている場合-1、それ以外の場合+1)を受け取ります。エージェントはプレイエリアから大きく外れた移動に対してペナルティを受けます。
自動カリキュラムと戦略の発現
"自動カリキュラム"と呼ばれるプロセスを通じて、エージェント間の競争は戦略と対戦略のサイクルを作り出します。一方のチームが勝つ方法を見つけると、それは対立するチームに新たな適応の圧力を生み出します。
シンプルな環境(ハイドラー2体、シーカー2体、ボックス2個、ランプ1個、ドアが1〜2個の部屋)では、エージェントはいくつかの段階の発現的な行動を開発しました。ランダム化が増加したフル環境(ハイドラー/シーカー1〜3体、ブロック3〜9個、ランプ2個、ランダム化された部屋)では、エージェントはさらに2つの段階の発現的戦略を経ました。
テクニカルアーキテクチャとトレーニング
ポリシーアーキテクチャ
エージェントは、オブジェクトおよび他のエージェントに対して順列不変なエンティティ中心の状態ベースの世界表現を使用します。アーキテクチャは、オブジェクトに対して時間ではなく注意を適用するマスクド残差自己注意ブロック—Transformerで使用されるものと同様—を採用しています。エージェントの視線外のオブジェクトはマスクされます。
トレーニング方法論
- アルゴリズム: ポリシーは自己対戦とProximal Policy Optimization(PPO)を使用して訓練されます。
- 価値関数: 最適化中、エージェントは価値関数において obscured (見えない) オブジェクトおよび他のエージェントに関する特権情報を使用できます。
- スケール: 大規模なトレーニングは発現に不可欠です。OpenAIは、バッチサイズ8kと16kでは"ランプ防御"ステージ(ステージ4)に到達できなかったことを発見し、より大きなバッチサイズがウォールクロック収束時間を大幅に加速させることを確認しました。
マルチエージェント競争 vs. 内在的動機付け
OpenAIはマルチエージェント競争と内在的動機付け(カウントベースの探索)を比較しました。ここでは、エージェントは頻繁に訪問されていない状態を訪れるようにインセンティブが与えられます。
- 定性的結果: マルチエージェントエージェントは、シェルター構築などの人間が解釈できる行動を開発しました。これに対し、内在的動機付けで訓練されたエージェントはオブジェクトを見かけ上無秩序に動かしました。
- スケーラビリティ: 状態空間の複雑さが増すにつれて、内在的動機付けの方法はオブジェクトとの意味のある相互作用が少なくなることが示されます。これは、マルチエージェント競争が教師なしの方法で人間に関連するスキルを生成するよりスケーラブルな方法であることを示唆しています。
転移とファインチューニングによる評価
報酬追跡やELOを超えた進歩を定量的に測定するため、OpenAIはドメイン固有の知能テストのスイートを提案しました:
- オブジェクト計数: オブジェクトの移動を予測することで、記憶とオブジェクト永続性をテストします。
- ロックと返却: 場所の長期記憶をテストします。
- シーケンシャルロック: 観測されていない順序のボックスの状態を覚える能力をテストします。
- ブループリント構築: ボックスを特定の目標場所に移動する能力をテストします。
- シェルター構築: シリンダーの周りにシェルターを構築する能力をテストします。
隠れんぼエージェントは多くのタスクでベースラインよりも良い成績を収めましたが、収束時間を劇的に改善するわけではありませんでした。OpenAIはこれを、ファインチューニングが困難な絡み合ったスキル表現によるものだと考えており、より多様な環境が一般化可能なスキル表現を生み出すために必要であると示唆しています。
意図しない行動とエクスプロイト
高忠実度の物理シミュレーターでエージェントを訓練すると、しばしば環境や物理のエクスプロイトが見つかります:
- ボックスサーフィン: エージェントはボックスをつかんだままその上に立ち、「サーフィン」してハイドラーの場所に移動します。
- エンドレスランニング: ハイドラーは時折、ボックスを取って無限に走り続けることを学び、シーカーを回避します。
- ランプの悪用: ハイドラーは接触物理学を悪用してランプをプレイエリアから取り除くことがあり、シーカーは特定の角度で壁にランプを当てて自分自身を上方に打ち上げることがあります。