OpenAI 和 Oxford 为多智能体强化学习引入 LOLA
OpenAI 和牛津大学推出了 Learning with Opponent-Learning Awareness (LOLA),这是一种强化学习(RL)框架,使智能体在更新自身策略时能够考虑其他智能体的学习过程。这种方法使智能体能够在竞争或合作游戏中发现互惠策略,克服了标准深度 RL 方法的局限性,这些方法往往导致自私且次优的结果。
强化学习中的心智理论
LOLA 实现了一种“心智理论”的形式,使智能体能够推理其自身行为如何影响其他智能体的未来行为。在传统的深度多智能体强化学习中,智能体通常将其他学习智能体视为环境的静态部分——类似于树或墙——而忽略了其他智能体也在调整其策略这一事实。
LOLA 通过建模另一个智能体(例如 “Bob”)的参数更新如何依赖于自身智能体的策略(例如 “Alice”)来区分自己。通过理解这种关系,Alice 可以更新她的策略,以一种更有利于她自身目标的方式塑造 Bob 的学习步骤。
技术实现与性能
LOLA 性能的核心是在策略更新过程中加入一个特定的数学项:
$$ \left(\left(\frac{\partial V^{1} (\theta_{i}^{1} , \theta_{i}^{2})}{\partial \theta_{i}^{2}}\right)^{T} \frac{\partial^{2} V^{2} (\theta_{i}^{1} , \theta_{i}^{2})}{\partial \theta_{i}^{1} \partial \theta_{i}^{2}} \cdot \delta \eta\right) $$
此项使智能体能够明确考虑他人的学习轨迹。此机制使得 LOLA 智能体能够在最先进的深度 RL 方法(如 Independent PPO)失效的环境中取得成功。虽然 Independent PPO 智能体通常会学习忽略他人目标的自私行为,但 LOLA 智能体的行为是出于一种将他人目标纳入自身利益的自利,而无需手工制定规则或预配置的合作环境。
在硬币游戏和囚徒困境中的应用
LOLA 智能体已经展示了在诸如迭代囚徒困境和硬币游戏等复杂场景中发现有效互惠策略的能力。
在硬币游戏中,两个智能体(红色和蓝色)竞争收集硬币。虽然任何硬币都提供一分,但收集相反颜色的硬币会导致该智能体受到 -2 分的惩罚。如果智能体通过贪婪地收集所有硬币而行动,平均得分为零。然而,LOLA 智能体学会主要收集自己颜色的硬币,通过塑造其他智能体的行为以促进合作,从而使双方都获得高得分。
Sources
- OriginalLearning to model other minds
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch