OpenAI Five

OpenAI Five,由五個神經網路組成的團隊,已經開始在 Dota 2 中擊敗業餘人類隊伍。

模型結構

OpenAI Five 中的每個英雄都由一個獨立的單層 1024 單位 LSTM 控制,該 LSTM 處理 20,000 維的觀測值,並透過八個列舉值頭發出動作。

訓練方法

OpenAI Five 完全透過自我對戰學習,使用在 256 個 GPU 和 128,000 個 CPU 核心上運行的擴大版 Proximal Policy Optimization 演算法,每天收集約 180 年的遊戲經驗。

探索

該代理透過以 80% 的時間對抗當前自我、20% 的時間對抗過去自我來進行探索,並伴隨隨機分配的線路和單位屬性;其獎勵為淨值、擊殺、死亡、助攻、最後一擊等,減去對方隊伍的平均獎勵。

協調

團隊合作源自一個「團隊精神」超參數,該參數在訓練期間從 0 退火到 1,在不需要任何明確通信渠道的情況下,將每個英雄的個人獎勵與團隊平均獎勵進行權衡。

系統基礎設施

訓練由 Rapid 框架執行,該框架將收集經驗的 rollout 工作者與執行同步梯度下降的優化器節點分離;經驗透過 Redis 同步,梯度則使用 NCCL2 包裝器進行平均;Rapid 在 Kubernetes、Azure 和 GCP 後端上運行。

遊戲結果

OpenAI Five 击败了一支 MMR 為 4.2k(第 93 個百分位數)的業餘隊伍;在逐步改進後,擊敗了最佳的 OpenAI 員工隊伍(MMR 2.5k,第 46 個百分位數)、Valve 員工隊伍(MMR 2.5‑4k,第 46‑90 個百分位數),並在對半職業隊伍(MMR 5.5k,第 99 個百分位數)以及一起訓練的業餘隊伍的三場非正式練習賽中贏得兩場。

與人類的差異

OpenAI Five 能即時獲得完整的遊戲狀態,每分鐘平均執行 150‑170 個動作(理論上最大 450),反應時間約為 80 ms,快於人類的反應時間。

意外發現

僅使用二元勝負獎勵會使學習速度慢下一個數量級;在沒有明確獎勵的情況下出現了小兵阻擋;該系統仍能擊敗強大的人類玩家,但仍存在一些嚴重錯誤,例如罕見的崩潰或在 25 級時出現的大幅負獎勵。

未來計畫

團隊計畫在 2018 年 8 月的國際邀請賽(The International)中,在受限英雄池下與頂級職業陣容對抗,並將在過程中發布更新,項目完成後發表最終報告。

summary: OpenAI Five,由五個神經網路組成的團隊,透過在 Dota 2 上的自我對戰進行訓練,開始擊敗業餘人類隊伍,並表明經過擴大的強化學習可以在不需要根本算法進步的情況下處理長時程、部分可觀測的任務。

OpenAI Five

Sources