OpenAI Five: Dota 2 强化学习

TL;DR

OpenAI Five 是一个强化学习系统,它在 2019 年 4 月 13 日击败了 Dota 2 世界冠军(Team OG)。这一成就证明了自我博弈强化学习可以扩展到解决具有长时界、不完全信息和复杂连续状态-动作空间的任务。

Dota 2 的技术挑战

与国际象棋或围棋等较简单的游戏不同,Dota 2 为 AI 系统带来了若干根本性的挑战。OpenAI Five 的设计旨在解决这些特定的复杂性:

  • 长时界 (Long Time Horizons): 游戏早期采取的行动可能会在几分钟后产生后果,这要求系统具备处理长期规划的能力。
  • 不完全信息 (Imperfect Information): 与完全信息游戏不同,Dota 2 要求 AI 在“战争迷雾”下运行,仅能看到游戏状态的部分可见部分。
  • 复杂的状态-动作空间 (Complex State-Action Spaces): 游戏具有连续的状态-动作空间,这意味着 AI 必须在复杂的环境中进行导航,其中精确的移动和目标选择是成功的策略。

扩展强化学习

OpenAI Five 利用了现有的强化学习技术,但将其扩展到了前所未有的水平。该系统的训练过程包括:

  • 分布式训练 (Distributed Training): OpenAI 开发了一个分布式训练系统和专门的持续训练工具,以在长时间内保持稳定性和稳定性。
  • 海量数据吞吐量 (Massive Data Throughput): 该系统每 2 秒钟就在大约 200 万帧的批次上进行训练。
  • 延长训练时长 (Extended Training Duration): 该系统总共训练了 10 个月才达到超人类水平的表现。

对通用人工智能的影响

通过击败世界冠军 Team OG,OpenAI Five 为自我博弈强化学习范式提供了一个概念验证。它表明,通过迭代的自我博弈,AI 可以发现有效的策略,并能针对同等水平的对手实现超人类的表现,从而在困难的现实世界任务中取得成功。这些挑战——长时界、不完全信息和连续空间——更有可能代表未来通用人工智能系统的特征。

Sources