OpenAI Five 基準結果

OpenAI Five 在對陣 99.95 百分位 Dota 玩家(其中包括四位職業玩家:Blitz、Cap、Fogged、Merlini 與 MoonMeander)的三局兩勝系列賽中獲勝。此結果顯示 AI 系統在處理現實環境中固有的高度複雜性與不確定性方面邁出了重要一步。

比賽結果與表現

OpenAI Five 顯示出依據選秀與對手技術水平的不同,在三種不同的比賽類型中有不同的成功程度:

高水平人類競賽

在對陣 99.95 百分位人類隊伍的三局兩勝系列賽中,OpenAI Five 贏得了前兩局。第一局在 21 分鐘 37 秒時取得勝利,第二局在 24 分鐘 53 秒時取得勝利。第三局在人群為 AI 選擇了對抗性英雄陣容後,由人類隊伍贏得,OpenAI Five 在 35 分鐘 47 秒時落敗。

觀眾志願者比賽

在與觀眾志願者組成的隊伍的首次公開比賽中,OpenAI Five 在前 14 分鐘內取得勝利,遠快於一般勢均力敵的比賽約 45 分鐘的常見時長。

對抗性選秀

在對高水平隊伍的第三局比賽中,觀眾為 OpenAI Five 選擇了一套「Looney‑Tunes」陣容,包含 Sven、Axe、Slark、Riki 與 Queen of Pain。這個對抗性選擇導致 OpenAI Five 在比賽開始前預測自己的勝率僅為 2.9%。

技術實作與選秀

OpenAI Five 使用具備勝率輸出的神經網路來評估遊戲狀態與選秀對陣。

自動化選秀

為了處理系統的英雄選秀能力,OpenAI Five 透過樹搜尋在 1,100 萬種可能的隊伍對陣中找出最佳選秀。此過程會為每個對陣建立一個虛擬畫面,並利用神經網路在第一個畫面上的勝率預測來評估潛在結果。

模型內省

AI 的內部預測常常與人類的感知不同。例如,在第 1 局比賽中,OpenAI Five 預測勝率為 95%,即使人類觀察者認為對陣勢均力敵。第 2 局則預測勝率為 76.2%。

訓練方法與計算資源

OpenAI Five 的訓練採用了在多個系統版本間持續參數初始化的流程,而非對每個版本從頭開始訓練。

參數手術

OpenAI 開發了「手術」工具,用於將舊參數映射至新網路架構。這使他們能夠微調特定行為,例如將同時用於移動與放偵的單一行動頭拆分為兩個獨立的克隆,以防止 AI 在移動時放偵。

計算資源

  • 1v1 模型:8 petaflop/s-days
  • June 6th 模型:11 petaflop/s-days
  • August 5th 模型:35 petaflop/s-days

模型規劃與預測

OpenAI 透過訓練輸出以預測未來的遊戲狀態,提供了模型規劃能力的洞見。這包括預測英雄(例如 Sven)六秒後的位置,以及預測其他數量,如塔的數量與最後擊殺次數。

Sources