Ataraxos AI 在预算有限的情况下利用信念网络击败顶级陆战棋选手

Ataraxos 击败了最强的人类陆战棋选手

名为 Ataraxos 的人工智能系统以 15 比 1 的战绩(另有 4 场平局)击败了世界冠军陆战棋选手 Pim Niemeijer,证明了在无需巨额计算预算的情况下,也可以掌握非完美信息棋盘游戏。

为什么隐藏信息让陆战棋对 AI 来说变得困难

陆战棋在战斗发生前会隐藏每枚棋子的身份,从而产生在数千步移动中不断展开的“海量隐藏信息”。陆战棋有 40 枚棋子,可以排列出超过 10 的 30 次方种配置,其状态空间远大于扑克牌的 1,326 种可能手牌。这种不确定性的深度,加上漫长的游戏时长(通常超过 2,000 步)以及虚张声势的博弈动态,使得 DeepMind 的 DeepNash 等早期 AI 尝试无法实现可靠的超人类水平表现。

核心技术突破:信念模型神经网络

Ataraxos 增加了一个第二个神经网络,通过移动模式来预测对手隐藏棋子的身份。信念模型不是枚举所有可能的棋盘排列,而是对合理的隐藏状态进行采样,在每个采样状态下对候选移动进行有限搜索,并选择预期结果最好的移动。这种方法使得在完整信息树极其庞大的游戏中进行前向搜索成为可能。

“解决方案是第二个神经网络,即一个信念模型,它通过训练来根据对手的移动方式猜测其隐藏的棋子。” – Gabriele Farina,麻省理工学院合著者

训练效率与规模

  • 自对弈游戏:总计 1.63 亿局,比 DeepNash 少约 34 倍。
  • 计算资源:16 块 GPU 运行一周,外加 4 块 GPU 运行四天来训练信念模型。
  • 成本:几千美元,相比之下 DeepNash 在 1,024 块 Google 定制芯片上的估计成本为 300 万至 450 万美元。
  • 模拟器:定制的 GPU 加速引擎每秒可运行数百万步,从而实现快速的强化学习更新。

Ataraxos 的游戏特征

  • 冷静、有条理的打法 – 得名于希腊语 ataraxos(宁静),该 AI 避免冲动的赌博,并能从低概率位置缓慢恢复。
  • 有效的虚张声势 – 信念模型让 AI 能够做出只有在对手虚张声势时才合理的移动,并且比人类更可靠地执行后续操作。
  • 非传统的旗帜放置 – 该机器人经常将其旗帜隐藏在角落里的两枚炸弹后面,这种设置很少被人类专家使用,迫使对手做出调整。

对阵 Pim Niemeijer 的比赛结果

  • 三周内进行了 20 场在线比赛;Niemeijer 每赢一场获得 100 美元。
  • 最终比分:Ataraxos 获胜 15 场,Niemeijer 获胜 1 场,平局 4 场。
  • 人类唯一的一场胜利归因于运气;即使是完美的打法也可能因为随机的初始棋子排列而输掉比赛。

更广泛的影响与扩展

相同的架构在以下领域取得了成功:

  • Barrage Stratego – 一种八枚棋子的快速变体,击败了三位世界冠军。
  • Hanabi – 一种玩家无法看到自己手牌的合作纸牌游戏。
  • 斗地主 – 一种流行的中国纸牌游戏,Ataraxos 的表现优于顶级机器人。

研究人员建议,这些技术可以转移到现实世界的领域,如战争博弈、谈判或金融市场,在这些领域中,构建隐藏信息的简化模型是第一步。

遗留挑战

  • 可解释性 – Ataraxos 目前无法解释为什么选择特定的移动;团队正在努力使策略更加透明。
  • 泛化能力 – 将信念模型搜索应用于具有动态规则集或不断扩展的动作空间的游戏(例如 Magic: The Gathering)仍然是一个未解决的问题。

社区反应(Hacker News 精选)

  • 用户注意到与 DeepNash 相比计算量大幅减少,并称赞信念模型的洞察力是关键创新。

    “该算法的学习速度也快得多——它玩的局数比 DeepNash 少了约 34 倍,但最终却强大得多。在我看来,这是关键所在,也是让 AI 真正发挥作用的原因。” – @janalsncm

  • 几位评论者回忆起个人的陆战棋经历,并对该游戏比国际象棋或围棋更难被 AI 攻克表示惊讶。
  • 一些人对变体规则(例如“静默防御”)以及该方法是否可以扩展到桥牌等其他非完美信息游戏提出了疑问。

未来方向

作者计划提高可解释性,探索更大规模的隐藏信息领域,并发布 Ataraxos 代码库(可在 https://ataraxosai.github.io/ 获取)。他们的结果表明,复杂的信念建模可以在没有高昂硬件成本的情况下,缩小人类直觉与机器计算之间的差距。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • 项目
  • Dispatch