OpenAI Five ベンチマーク結果
OpenAI Five は 99.95 パーセンタイルの Dota プレイヤーのチーム(プロプレイヤー4名:Blitz、Cap、Fogged、Merlini、MoonMeander を含む)に対してベストオブスリーシリーズで勝利しました。この結果は、実世界環境に固有の高い複雑性と不確実性を管理できる AI システムへの重要な一歩を示しています。
試合結果とパフォーマンス
OpenAI Five は、ドラフトと対戦相手のスキルレベルに応じて、3 つの異なる試合タイプで成功度が異なることを示しました。
高スキル人間対戦
99.95 パーセンタイルの人間チームとのベストオブスリーシリーズで、OpenAI Five は最初の 2 試合に勝利しました。第1試合は 21 分 37 秒で、第2試合は 24 分 53 秒で勝ちました。観客が AI に対して敵対的なヒーロー編成を選択したため、人間チームが第3試合に勝利し、OpenAI Five は 35 分 47 秒で敗北しました。
観客ボランティアマッチ
観客ボランティアのチームとの最初の公開マッチで、OpenAI Five は最初の 14 分以内に勝利し、均衡した試合の通常 45 分という所要時間よりもはるかに速く終了しました。
敵対的ドラフト
高スキルチームとの第3試合で、観客は OpenAI Five 用に Sven、Axe、Slark、Riki、Queen of Pain からなる「Looney‑Tunes」編成を選択しました。この敵対的な選択により、OpenAI Five は試合開始前に自分の勝率をわずか 2.9% と予測しました。
技術的実装とドラフト
OpenAI Five は、勝率出力を持つニューラルネットワークを利用してゲーム状態とドラフトのマッチアップを評価します。
自動ドラフト
ヒーローをドラフトするシステムの能力を処理するために、OpenAI Five は 1,100 万通りの可能なチームマッチアップの中から最適なドラフトを見つけるためにツリー検索を使用します。このプロセスでは、各マッチアップごとに偽のフレームを作成し、最初のフレームでネットワークの勝率予測を用いて潜在的な結果を評価します。
モデル内省
AI の内部予測はしばしば人間の認識と異なります。例えば、ゲーム 1 では OpenAI Five が 95% の勝率を予測したにもかかわらず、人間の観測者はマッチアップは均衡していると考えていました。ゲーム 2 では 76.2% の勝率を予測しました。
訓練手法と計算資源
OpenAI Five は、各バージョンをゼロから訓練するのではなく、複数のシステムリビジョンにわたって継続的にパラメータを初期化するプロセスで訓練されました。
パラメータサージェリー
OpenAI は「サージェリー」ツールを開発し、古いパラメータを新しいネットワークアーキテクチャにマッピングしました。これにより、移動とワーディングの両方に使用される単一のアクションヘッドを 2 つの別々のクローンに分割するなど、特定の動作を洗練させ、AI が移動中にワードを落とすことを防止できました。
計算資源
さまざまな Dota システムの訓練に使用された推定計算量は以下の通りです。
- 1v1 モデル: 8 petaflop/s-days
- 6月6日モデル: 11 petaflop/s-days
- 8月5日モデル: 35 petaflop/s-days
モデル計画と予測
OpenAI は、モデルの計画能力に関する洞察を提供するために、出力を訓練して将来のゲーム状態を予測させました。これには、ヒーロー(例:Sven)の位置を 6 秒先に予測することや、タワー数やラストヒット数などの他の量を予測することが含まれます。
Sources
- OriginalOpenAI Five Benchmark: Results