OpenAI Five: Dota 2 強化学習

TL;DR

OpenAI Fiveは、2019年4月13日にDota 2の世界チャンピオン(Team OG)を破った強化学習システムです。この成果は、自己対戦による強化学習が、長いタイムホライゾン、不完全情報、そして複雑で連続的な状態・行動空間を持つタスクを解決するためにスケールできることを証明しています。

Dota 2の技術的課題

Dota 2は、チェスや囲碁のような単純なゲームとは異なる、AIシステムにとってのいくつかの根本的な課題を提示します。OpenAI Fiveは、これらの特定の複雑さを解決するように設計されました:

  • Long Time Horizons (長いタイムホライゾン): ゲームの序盤に行われた行動が、数分後に影響を及ぼすことがあり、システムには長期的な計画能力が求められます。
  • Imperfect Information (不完全情報): 完全情報ゲームとは異なり、Dota 2はAIが「fog of war(戦場の霧)」の下で、ゲーム状態の一部しか見えない状態で動作することを要求します。
  • Complex State-Action Spaces (複雑な状態・行動空間): このゲームは連続的な状態・行動空間を特徴としており、これはAIが、正確な動きとターゲットの選択が成功の戦略となる複雑な環境をナビゲートしなければならないことを意味します。

強化学習のスケーリング

OpenAI Fiveは既存の強化学習技術を活用しましたが、それらを前例のないレベルまでスケールさせました。システムのトレーニングプロセスには以下が含まれます:

  • Distributed Training (分散トレーニング): OpenAIは、長期にわたって安定性を維持するために、分散トレーニングシステムと継続的なトレーニングのための専門的なツールを開発しました。
  • Massive Data Throughput (大規模なデータスループット): システムは、約200万フレームのバッチを2秒ごとにトレーニングしました。
  • Extended Training Duration (長期にわたるトレーニング期間): システムは、超人的なパフォーマンスレベルに到達するために、合計10ヶ月間トレーニングされました。

汎用AIへの影響

世界チャンピオンであるTeam OGを破ることで、OpenAI Fiveは自己対戦による強化学習パラダイムの概念実証となりました。これは、AIが反復的な自己対戦を通じて、同レベルの相手に対して効果的な戦略を発見できることを示しており、困難な現実世界のタスクにおいて超人的なパフォーマンスを達成できることを示しています。これらの課題(長いタイムホライゾン、不完全情報、連続的な空間)は、将来の汎用AIシステムをより象徴するものとなる可能性が高いです。

Sources