OpenAI Five ベンチマーク結果

OpenAI Five は 99.95 パーセンタイルの Dota プレイヤーのチーム(プロプレイヤー4名:Blitz、Cap、Fogged、Merlini、MoonMeander を含む)に対してベストオブスリーシリーズで勝利しました。この結果は、実世界環境に固有の高い複雑性と不確実性を管理できる AI システムへの重要な一歩を示しています。

試合結果とパフォーマンス

OpenAI Five は、ドラフトと対戦相手のスキルレベルに応じて、3 つの異なる試合タイプで成功度が異なることを示しました。

高スキル人間対戦

99.95 パーセンタイルの人間チームとのベストオブスリーシリーズで、OpenAI Five は最初の 2 試合に勝利しました。第1試合は 21 分 37 秒で、第2試合は 24 分 53 秒で勝ちました。観客が AI に対して敵対的なヒーロー編成を選択したため、人間チームが第3試合に勝利し、OpenAI Five は 35 分 47 秒で敗北しました。

観客ボランティアマッチ

観客ボランティアのチームとの最初の公開マッチで、OpenAI Five は最初の 14 分以内に勝利し、均衡した試合の通常 45 分という所要時間よりもはるかに速く終了しました。

敵対的ドラフト

高スキルチームとの第3試合で、観客は OpenAI Five 用に Sven、Axe、Slark、Riki、Queen of Pain からなる「Looney‑Tunes」編成を選択しました。この敵対的な選択により、OpenAI Five は試合開始前に自分の勝率をわずか 2.9% と予測しました。

技術的実装とドラフト

OpenAI Five は、勝率出力を持つニューラルネットワークを利用してゲーム状態とドラフトのマッチアップを評価します。

自動ドラフト

ヒーローをドラフトするシステムの能力を処理するために、OpenAI Five は 1,100 万通りの可能なチームマッチアップの中から最適なドラフトを見つけるためにツリー検索を使用します。このプロセスでは、各マッチアップごとに偽のフレームを作成し、最初のフレームでネットワークの勝率予測を用いて潜在的な結果を評価します。

モデル内省

AI の内部予測はしばしば人間の認識と異なります。例えば、ゲーム 1 では OpenAI Five が 95% の勝率を予測したにもかかわらず、人間の観測者はマッチアップは均衡していると考えていました。ゲーム 2 では 76.2% の勝率を予測しました。

訓練手法と計算資源

OpenAI Five は、各バージョンをゼロから訓練するのではなく、複数のシステムリビジョンにわたって継続的にパラメータを初期化するプロセスで訓練されました。

パラメータサージェリー

OpenAI は「サージェリー」ツールを開発し、古いパラメータを新しいネットワークアーキテクチャにマッピングしました。これにより、移動とワーディングの両方に使用される単一のアクションヘッドを 2 つの別々のクローンに分割するなど、特定の動作を洗練させ、AI が移動中にワードを落とすことを防止できました。

計算資源

さまざまな Dota システムの訓練に使用された推定計算量は以下の通りです。

  • 1v1 モデル: 8 petaflop/s-days
  • 6月6日モデル: 11 petaflop/s-days
  • 8月5日モデル: 35 petaflop/s-days

モデル計画と予測

OpenAI は、モデルの計画能力に関する洞察を提供するために、出力を訓練して将来のゲーム状態を予測させました。これには、ヒーロー(例:Sven)の位置を 6 秒先に予測することや、タワー数やラストヒット数などの他の量を予測することが含まれます。

Sources