OpenAI 競争的セルフプレイ研究

OpenAI は、競争的セルフプレイにより、シミュレートされた AI エージェントがタックル、ダッキング、フェイキング、キック、キャッチ、ダイビングなどの複雑な身体スキルを発見できることを示した。これらの行動が環境に明示的にプログラムされていない状況下でも。このアプローチは、トレーニング環境が AI の改善に最適な難易度レベルで維持されることを保証し、セルフプレイが将来の強力な AI システムの基盤となるコンポーネントであることを示唆している。

単純な目標から生じる挙動

競争的プレッシャーと単純な報酬構造の組み合わせにより、エージェントは自身のパフォーマンスをブートストラップできる。シミュレートされた 3D ロボットが基本的なゲームを行う実験において、OpenAI は Proximal Policy Optimization (PPO) を使用し、各エージェントのニューラルネットワークポリシーを独立して訓練した。

トレーニング方法論

エージェントは 2 段階の報酬システムを使用して訓練される:

  1. 密な報酬: 初期段階では、立ち上がることや前進するなどの基本的な探索行動に対して報酬が与えられる。
  2. 競争報酬: これらの密な報酬はゼロに向かって徐々に減衰させられ、エージェントの焦点は勝つか負けるかという主要な目標(例えば、相手を相撲の輪から押し出すか、ボールをネットに蹴り込むか)にシフトされる。

ケーススタディ: 相撲

相撲のタスクでは、OpenAI は humanoid の歩行訓練に関する過去の研究に基づいた密な探索報酬を利用し、速度項を削除し、リングの中心からの負の L2 距離を追加した。エージェントがリングを探索し終えた後、この報酬はゼロに減衰させられ、エージェントは競争報酬である「相手をリングから押し出す」ことを最適化するよう強制された。

転移学習と一般化

競争的セルフプレイを通じて訓練されたエージェントは転移学習を示し、つまり一つの環境で学習したスキルを未知の新しい環境に適用できるということである。

ある特定のテストでは、相撲訓練を受けたエージェントが「風」の力によって攪乱される環境に配置された。トレーニング中に風に遭遇したことがなかったにもかかわらず、相撲エージェントは立ち続けることができた。対照的に、古典的強化学習で歩行を訓練されたエージェントは、同じ力にさらされるとすぐに倒れた。

セルフプレイにおけるオーバーフィッティングの軽減

OpenAI は、エージェントが単一の相手に特化したポリシーを共同で学習し、一般的な戦略を開発する代わりにオーバーフィッティングのリスクがあることを特定した。エージェントが狭い、相手特有のカウンターを学習するのを防ぐため、OpenAI は以下の戦略を実装した:

  • 多様な対戦相手アンサンブル: エージェントは同時に複数の異なる対戦相手と対戦させられた。
  • ポリシー履歴: エージェントはトレーニングプロセスの初期段階のポリシーと対戦した。

多様なポリシーのアンサンブルとトレーニングを行うことにより、エージェントはさまざまな対戦相手に対して有効な一般的な戦略を開発するよう強制された。

可用性

OpenAI は、この研究で使用された MuJoCo 環境と訓練済みポリシーを GitHub を通じて一般公開し、セルフプレイシステムのさらなる実験を容易にした。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch