OpenAI FiveがDota 2の世界チャンピオンを破った
OpenAI Fiveは、世界チャンピオンであるDota 2チームOGに対して2試合連続で勝利し、eスポーツのゲームにおいて世界チャンピオンを破った初のAIです。この成果は、AIがライブ配信環境下でeスポーツのプロを破った初めての事例となります。
Scaling Compute as the Primary Driver of Performance
OpenAI Fiveが世界クラスの性能に到達するための根本的な要件は、新しいアルゴリズムの複雑さではなく、スケールでした。チームは当初、高度な階層的強化学習が必要になると予想していましたが、トレーニングのプロセスをスケールさせることが、必要なブレイクスルーをもたらすことが分かりました。
To achieve this, OpenAIは、Proximal Policy Optimization (PPO)を前例のない規模で実行するために、Rapidというシステムを開発しました。その結果、現在の強化学習 (RL) アルゴリズムは、膨大な量の経験を提供することで非常に強力になることが示されました。ただし、これはシミュレーション環境以外でのアプリケーションにおいては、依然として課題として残っています。
Training Scale and Compute Statistics
OGに対する勝利は、The International 2018で競ったOpenAI Fiveのバージョンと比較して、トレーニングの計算資源(compute)が8倍に増加したことによるものでした。このプロジェクトでは、すでに単一モデルのために利用可能な計算資源の大部分を使い果たしていたため、チームはトレーニング期間を延長することでスケールを拡大しました。
FinalsバージョンのOpenAI Fiveの主な計算指標は以下の通りです:
- Total Compute: 800 petaflop/s-days.
- Simulated Experience: 約45,000年のDota自己対戦(self-play)が、実時間の10ヶ月間にわたって行われました。
- Daily Experience: 1日平均250年のシミュレーション経験。
現在のゲームパッチで評価した場合、FinalsバージョンのOpenAI Fiveは、The Internationalで使用されたバージョンに対して99.9%の勝率を維持しています。
Long-term Training and Transfer Learning
OpenAI Fiveは2018年6月から継続的にトレーニングを行っています。このシステムは、モデルのサイズ変更やゲームルールの更新(パッチ)を跨いで学習を転移させる能力を示しました。これは、アーキテクチャの変更を伴う長期的なトレーニングランを維持することは通常、未解決の課題であるため、RLにおける重要なマイルストーンとなります。
これを促進するために、OpenAIは「surgery」ツールを使用して、大幅なアーキテクチャの変更後でもモデルが以前にトレーニングされたパラメータから開始できるようにしました。
Hero Pool Expansion and Limitations
Hero Poolの拡大と制限について: FinalsバージョンのOpenAI Fiveは、17体のヒーローを使用します。チームは、ヒーローのプールを5体から18体へと、トレーニングの速度低下をほとんど起こさずに拡大することに成功しましたが、25体のヒーローにスケールさせようとした試みでは、学習速度の低下が見られました。
25体のヒーロープールにおけるヒーローは、約5k MMR(プレイヤーの約95パーセンタイル)に達しましたが、Finalsまでにプロレベルには達しませんでした。OpenAIは、これがモデルの容量不足、拡大されたプールに対するより良いマッチングの必要性、または新しいヒーローが既存のヒーローに追いつくためのより多くのトレーニング時間が必要であるためではないかと仮定しています。
Zero-Shot Transfer to Human Cooperation
Zero-Shot Transferについて: Despite being trained exclusively to compete against other bots, OpenAI Five exhibited a rudimentary ability to act as a teammate for humans. This is an example of zero協調トレーニングなしで、エージェントが人間の協調動作を一般化して行えるようになった、zero-shot transfer learningの例です。
Public Testing via OpenAI Five Arena
Public Testingについて: To test the exploitability of highly competent deep reinforcement learning agentを、OpenAIはOpenAI Five Arenaを立ち上げました。この公開実験では、コミュニティが対戦モードと協力モードの両方でAIと対インタラクションを行えるようになり、高度に有能能な深層強化学習エージェントの公開インタラクションのための最大のデプロイメントとなりました。