学习协作、竞争与交流 – OpenAI 2017 研究公告
TL;DR
OpenAI 发布了 MADDPG 算法,用于多智能体强化学习中的集中式学习和分布式执行,表明智能体可以比以往的方法更好地学习协作、竞争和交流。
引言
智能体在其中争夺资源的多智能体环境被视为迈向 AGI 的垫脚石。它们提供了一种天然的课程——难度与竞争者的技能相匹配——并且没有稳定的均衡,从而产生了不断进步的压力。
传统 RL 的困境
传统的分布式 RL 方法,如 DDPG、actor‑critic 和 deep Q‑learning,在多智能体设置中表现不佳,因为每个智能体在采取行动的同时,还必须尝试预测他人的行动,尤其是在竞争场景中。策略梯度方法存在高方差问题,而引入 critic 虽然提高了稳定性,但仍无法解决诸如协作通信之类的任务。在训练过程中考虑他人的行动对于学习协作策略至关重要。
MADDPG 算法
我们开发了 MADDPG (Multi‑Agent Deep Deterministic Policy Gradient),以实现集中式学习和分布式执行。该算法通过借鉴 actor‑critic 技术扩展了 DDPG。
- 每个智能体都被视为一个“actor”,它接收来自“critic”的建议,以决定在训练期间强化哪些行动。
- 在标准 RL 中,critic 预测给定状态下某个行动的价值(预期未来奖励),actor 利用该价值来更新其策略。
- 为了使多智能体学习变得可行,我们增强了 critic,使其能够访问所有智能体的观测值和行动,如流程图所示。
- 在测试时,智能体不需要中央 critic;它们根据自己的观测值以及对其他智能体行为的预测来行动。
- 由于为每个智能体独立学习一个集中式 critic,该方法可以模拟任意的奖励结构,包括奖励相互对立的对抗情况。
实验结果
我们在各种任务上测试了 MADDPG,发现它在所有任务上的表现都优于 DDPG。随附的动画展示了:
- 两个 AI 智能体学习前往特定位置,同时通过分散行动来向对手隐藏其预定位置。
- 一个智能体向另一个智能体传达地标的名称。
- 三个智能体协作前往地标而不发生碰撞。
初期的研究挑战
在 MADDPG 之前,使用分布式技术时我们观察到,当说话者发送关于去向的不一致信息时,听者智能体往往会学会忽略说话者。听者会将与说话者信息相关的所有权重设为零,从而实际上让自己“失聪”。一旦发生这种情况,恢复就会变得困难,因为说话者无法收到关于其信息是否正确的反馈。
我们尝试了一种来自近期分层强化学习项目的技术,强制听者纳入说话者的言语,但这只是让听者开始关注,却无法帮助说话者学习哪些言语是相关的。
MADDPG 中的集中式 critic 通过帮助说话者学习哪些言语可能与他人的行动相关,从而解决了这个问题。
下一步工作
智能体建模在 AI 研究中有着悠久的历史,早期的工作侧重于时间步长少、状态空间小的游戏。深度学习现在可以处理复杂的视觉输入,而 RL 为长期行为的学习提供了工具。
通过 MADDPG,我们可以同时训练多个智能体,而不需要它们了解环境的动力学,这为涉及通信、语言和从高维信息中学习的更广泛问题打开了大门。
欢迎对进化智能体感兴趣的研究人员考虑 OpenAI 的机会。
作者
Ryan Lowe, Igor Mordatch, Pieter Abbeel, Yi Wu, Aviv Tamar, Jean Harb