OpenAI メタラーニング レスリング向け
OpenAI は、シミュレートされたロボットレスリング用のメタラーニング エージェントを開発し、より強い相手に打ち勝つために戦略を素早く適応させ、物理的な故障を補うことができる。この能力により、エージェントは新しい環境や相手との少数のインタラクションに基づいてリアルタイムでパフォーマンスを最適化できる。
マルチエージェント適応のための変更済み MAML
OpenAI は、単一の環境ではなく環境のペアに対して最適化するように、Model-Agnostic Meta-Learning (MAML) アルゴリズムを拡張した。標準の MAML は、最小のパラメータ更新で新しいタスクに素早く適応できるようにポリシーを初期化するが、この変更済みバージョンは、以前のトレーニングデータから大きく逸脱しない限り、未見の環境に適応することをエージェントに許可する。
実行中、エージェントは新しい環境との最初の数エピソードで収集された報酬に対して勾配上昇ステップを実行する。このプロセスにより、エージェントは特定の相手に対してより効果的に対抗するために、ポリシー パラメータをオン・ザ・フライで洗練させることができる。
実験のセットアップと結果
連続した適応をテストするために、OpenAI は形態が異なる 3 種類のシミュレートされたエージェントを使用した:
- Ant (4本足)
- Bug (6本足)
- Spider (8本足)
これらのエージェントは、同じ相手と複数の試合を行うマルチラウンド ゲームで競い合った。メタラーニング エージェントは、ラウンド間でポリシー パラメータを適応させ、相手の特定の戦略に対抗した。OpenAI は、戦術を適応できるエージェントが、固定ポリシーのエージェントよりもはるかに成功する競争者であることを発見した。
物理的故障への適応
外部の相手への適応に加えて、メタラーニング アプローチはエージェントが内部の変化に対処できるようにする。OpenAI は、エージェントが時間の経過とともに自身の一部の肢の機能喪失などの物理的故障に適応できることを実証した。これは、メタラーニングを使用して、外部の環境変化および自身の内部状態や身体の変化の両方に対処できるエージェントを開発できることを示唆している。
可用性と研究コンテキスト
この研究は、大規模マルチエージェント システムへの OpenAI の広範な研究の一部である。さらなる実験を容易にするために、OpenAI は GitHub を通じて研究で使用された MuJoCo 環境とトレーニング済みポリシーをリリースした。
Sources
- OriginalMeta-learning for wrestling
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch