OpenAI Five
OpenAI Five,一个由五个神经网络组成的团队,已经开始在Dota 2中击败业余人类队伍。
Model Structure
OpenAI Five中的每个英雄由一个独立的单层1024单元LSTM控制,该LSTM处理20,000维的观察数据,并通过八个枚举值头输出动作。
Training Approach
OpenAI Five完全通过在256个GPU和128,000个CPU核心上运行的扩大规模的近端策略优化(Proximal Policy Optimization)算法进行自博弈学习,每天收集约相当于180年的游戏经验。
Exploration
该智能体通过让80%的游戏对抗当前自身、20%的游戏对抗过去的自身来进行探索,同时随机分配路径和单位属性,并获得净值、击杀、死亡、助攻、最后一击等奖励,减去对手队伍的平均奖励。
Coordination
团队合作源自一个在训练过程中从0退火到1的“团队精神”超参数,它在不需要任何显式通信渠道的情况下,将每个英雄的个人奖励与团队平均奖励进行权衡。
System Infrastructure
训练由Rapid框架执行,该框架将收集经验的rollout工作节点与执行同步梯度下降的优化器节点分离;经验通过Redis同步,梯度使用NCCL2包装器进行平均;Rapid在Kubernetes、Azure和GCP后端上运行。
Gameplay Results
OpenAI Five击败了具有4.2k MMR(第93百分位)的业余队伍;在逐步改进后,它击败了最佳的OpenAI员工队伍(2.5k MMR,第46百分位)、Valve员工队伍(2.5‑4k MMR,第46‑90百分位),并在与半职业队伍(5.5k MMR,第99百分位)以及一起训练的业余队伍的三场非正式对抗赛中赢得了两场。
Differences Versus Humans
Open AI Five能够即时获得完整的游戏状态,每分钟平均执行150‑170个动作(理论最大值450),反应时间约为80 ms,快于人类的反应时间。
Surprising Findings
仅凭二进制胜负奖励会使学习速度慢下来一个数量级;爬兵阻挡在没有显式奖励的情况下出现;而且该系统仍能击败强大人类玩家,尽管其中存在一些严重的错误,例如罕见的崩溃或在25级时出现的大负奖励。
Future Plans
团队计划在2018年8月的国际邀请赛(The International)上,在受限英雄池下使用顶级职业阵容进行比赛,并在过程中发布更新,项目完成后将发布最终报告。
Sources
- OriginalOpenAI Five