OpenAI MADDPG: 学习合作、竞争与沟通

OpenAI 开发了 MADDPG,这是一种全新的强化学习 (RL) 算法,旨在用于智能体必须学习合作、竞争和沟通的多智能体环境。通过利用中心化学习与去中心化执行,MADDPG 允许智能体协调其行动并适应其他智能体的行为,从而克服了传统去中心化 RL 中固有的不稳定性。

中心化学习与去中心化执行

MADDPG 扩展了 Deep Deterministic Policy Gradient (DDPG) 算法,并结合了 actor-critic 强化学习技术。其核心创新在于为每个智能体使用一个中心化 critic。

  • The Actor: 模拟中的每个智能体都充当一个 actor,根据其自身的观察和对其他智能体行为的预测来决定采取哪些行动。
  • The Centralized Critic: 在训练期间,每个 actor 与一个 critic 配对,该 critic 可以访问环境中所有智能体的观察和行动。通过预测特定状态下某个行动的预期未来奖励(价值),该 critic 为 actor 提供关于哪些行动需要加强的建议。
  • Decentralized Execution: 智能体在测试时不需要访问中心化 critic。它们仅根据自身的观察和对其他智能体行为的预测进行操作。

这种架构允许 MADDPG 对任意奖励结构进行建模,包括奖励相反的对抗性案例,并将不可预测的多智能体环境转化为训练过程中的可预测环境。

克服传统 RL 的局限性

传统的去中心化 RL 方法——例如 DDPG、actor-critic 学习和 deep Q-learning——在多智能体设置中表现挣扎,因为智能体必须在执行自身行动的同时,学习预测他人的行动。这创造了一个非平稳环境,其中一个智能体的策略会随着其他人的学习而改变,使得智能体难以收敛到稳定的策略。

此外,策略梯度方法通常表现出高方差,当奖励不一致时,很难学习到正确的策略。OpenAI 发现,仅仅在去中心化 RL 中添加一个 critic 仍然无法解决诸如协作式沟通的任务,因为智能体在训练期间需要考虑他人的行动,以制定协作策略。

实证结果与能力

OpenAI 在各种任务中测试了 MADDPG,它在所有情况下都优于 DDPG。展示的能力包括:

  • Coordinated Chasing: 四个红色智能体学会了组队去追逐两个绿色智能体,而绿色智能体学会了分散开来以避免被捕获并到达目标(一个蓝色圆圈)。
  • Strategic Hiding: 两个智能体学会了分散开来,以向对手智能体隐藏其预定的目的地。
  • Cooperative Communication: 一个智能体学会了向另一个智能体传达地标名称。
  • Collision Avoidance: 三个智能体协调其动作以前往地标而不会发生碰撞。

对 AGI 的启示

OpenAI 将多智能体环境视为通往通用人工智能 (AGI) 的关键阶梯,主要基于两个原因:

  1. Natural Curriculum: 环境的难度会自动根据竞争对手的技能水平进行缩放。如果智能体与自身的克隆体竞争,环境的难度将正好匹配其当前的技能水平。
  2. Lack of Stable Equilibrium: 由于始终存在变得更聪明以超越竞争对手的压力,因此在这些环境中,智能体的智能水平没有上限。

通过将深度学习处理复杂视觉输入的能力与 RL 学习长期行为的能力相结合,MADDPG 使得在无需预先了解环境动力学的情况下,即可在高维环境中研究沟通与语言。

Sources