OpenAI Five 击败 Dota 2 世界冠军
OpenAI Five 是第一个在电竞游戏中击败世界冠军的 AI,它在与世界冠军 Dota 2 战队 OG 的两场连续对决中取得了胜利。这一成就标志着 AI 首次在现场直播的环境中击败了电竞职业选手。
Scaling Compute as the Primary Driver of Performance
OpenAI Five 达到世界级水平的核心需求是规模,而非新的算法复杂度。虽然团队最初预计需要复杂的层次化强化学习,但他们发现扩大训练规模是实现突破的关键。
为了实现这一点,OpenAI 开发了一个名为 Rapid 的系统,以史无前例的规模运行 Proximal Policy Optimization (PPO)。结果表明,当前的强化学习 (RL) 算法在获得海量经验时表现得极其强大,尽管这对于模拟环境之外的应用仍然是一个挑战。
Training Scale and Compute Statistics
战胜 OG 的原因归功于训练算力的 8 倍增长,相比于在 The International 2018 参赛的 OpenAI Five 版本。由于该项目已经为单个模型利用了大部分可用算力,团队通过延长训练时长来增加规模。
OpenAI Five 决赛版本的关键算力指标包括:
- Total Compute: 800 petaflop/s-days.
- Simulated Experience: 大约 45,000 年的 Dota 自我博弈经验,历时 10 个真实月。
- Daily Experience: 平均每天 250 年的模拟经验。
在当前游戏版本(patch)下进行评估时,OpenAI Five 决赛版本相对于 The International 版本保持了 99.9% 的胜率。
Long-term Training and Transfer Learning
OpenAI Five 自 2018 年 6 月以来一直在持续训练。该系统展示了在模型规模变化和游戏规则更新(patches)的情况下进行迁移学习的能力。这代表了强化学习 (RL) 中的一个重要里程碑,因为在架构变更期间维持一个长期的训练运行是一个典型的开放性挑战。
ypticity
为了实现这一点,OpenAI 利用了 "surgery" 工具,允许模型在进行重大架构修改后仍能从先前训练的参数开始。
Hero Pool Expansion and Limitations
OpenAI Five 决赛版本可以使用 17 个英雄。虽然团队成功地将英雄池从 5 个扩展到 18 个英雄,且训练速度几乎没有减慢,但尝试扩展到 25 个英雄时,学习速度出现了放缓。
25 个英雄池中的英雄达到了大约 5k MMR(大约处于玩家的前 5%),但在决赛前并未达到职业水平。OpenAI 假设这可能是由于模型容量不足、扩展英雄池需要更好的匹配机制,或者新英雄需要更多训练时间才能赶上已有的英雄。
Zero-Shot Transfer to Human Cooperation
尽管仅针对对抗其他机器人进行训练,OpenAI Five 展示了作为人类队友的初步能力。这是一个零样本迁移学习(zero-shot transfer learning)的例子,因为智能体在没有专门的协作训练的情况下,将其行为泛化到了与人类协作。
Public Testing via OpenAI Five Arena
为了测试智能体的可利用性(exploitability)和性能的稳定性,OpenAI 启动了 OpenAI Five Arena。这项公开实验允许社区与 AI 进行互动,包括竞争模式和协作模式,这是目前为止针对公众互动而部署的最大规模的高能力深度强化学习智能体。