OpenAI Five 擊敗 Dota 2 世界冠軍

OpenAI Five 是第一個在電競遊戲中擊敗世界冠軍的 AI,它在對陣世界冠軍 Dota 2 戰隊 OG 時連續贏得兩場比賽。這項成就標誌著 AI 首次在現場直播的環境中擊敗電競職業選手。

Scaling Compute as the Primary Driver of Performance

OpenAI Five 要達到世界級水準的性能,其根本需求是規模(scale)而非新的演算法複雜度。雖然團隊最初預期需要複雜的分層強化學習(hierarchical reinforcement learning),但他們發現擴大訓練規模是提供必要突破的關鍵。

為了實現這一點,OpenAI 開發了一個名為 Rapid 的系統,以史無前例的規模運行 Proximal Policy Optimization (PPO)。結果顯示,當提供海量經驗時,目前的強化學習(RL)演算法非常強大,儘管這對於模擬環境之外的應用仍是一項挑戰。

Training Scale and Compute Statistics

擊敗 OG 的勝利歸功於與在 The International 2018 參賽的 OpenAI Five 版本相比,訓練算力增加了 8 倍。由於該專案已經為單一模型利用了大部分可用算力,團隊透過延長訓練時間來增加規模。

OpenAI Five 決賽版本的關鍵算力指標包括:

  • Total Compute: 800 petaflop/s-days.
  • Simulated Experience: 大約 45,000 年的 Dota 自我對弈(self-play)經驗,歷時 10 個實際月。
  • Daily Experience: 平均每天 250 年的模擬經驗。

在目前的遊戲版本(patch)下進行評估時,決賽版本的 OpenAI Five 對於 The International 版本所使用的版本維持著 99.9% 的勝率。

Long-term Training and Transfer Learning

OpenAI Five 自 2018 年 6 月起持續進行訓練。該系統展示了在模型大小變化和遊戲規則更新(patches)之間進行遷移學習(transfer learning)的能力。這在 RL 中代表了一個重要的里程碑,因為在架構變更時維持長期的訓練運行是通常的一個開放性挑戰。

為了促進這一點,OpenAI 利用了「手術」(surgery)工具,讓模型可以在進行大幅度的架構修改後,仍能從先前訓練過的參數開始。

Hero Pool Expansion and Limitations

OpenAI Five 決賽版本可以使用 17 位英雄。雖然團隊成功地將英雄池從 5 位擴展到 18 位英雄,且訓練速度幾乎沒有減慢,但嘗試擴展到 25 位英雄時,學習速度出現了減慢。

25 位英雄池中的英雄達到了大約 5k MMR(大約是玩家的前 5%),但在此之前並未達到職業水準。OpenAI 推測這可能是由於模型容量不足、擴大英雄池需要更好的配對機制,或是新英雄需要更多訓練時間才能趕上已建立的英雄。

Zero-Shot Transfer to Human Cooperation

儘管僅針對與其他機器人對抗進行訓練,OpenAI Five 展現了作為人類隊友的初步能力。這是零樣本遷移學習(zero-shot transfer learning)的一個例子,因為該代理(agent)將其行為泛化到與人類合作,而無需專門的合作訓練。

Public Testing via OpenAI Five Arena

為了測試代理的漏洞利用性(exploitability)與性能的可靠性,OpenAI 推發了 OpenAI Five Arena。這項公開實驗允許社群與 AI 在競爭模式和合作模式下進行互動,成為了目前最大規模的供公眾互動的高能力深度強化學習代理的部署。

Sources