OpenAI 具有对手学习意识的学习 (LOLA)

TL;DR

OpenAI 已经提出了具有对手学习意识的学习 (LOLA),这是一种专为多智能体环境设计的强化学习方法。LOLA 使智能体能够主动塑造对手的预期学习,从而在诸如囚徒困境的迭代版本(IPD)之类的社会困境中促进合作的出现,并在诸如重复匹配便士之类的零和博弈中实现纳什均衡的收敛。

多智能体强化学习中的非平稳性挑战

在多智能体强化学习(MARL)中,由于所有智能体同时学习并更新其策略,环境变得非平稳。这种非平稳性经常导致训练不稳定或最终结果不理想。这一挑战适用于广泛的环境,包括深度多智能体 RL、分层 RL、高阶基于梯度的方法以及生成对抗网络(GANs)。

LOLA 算法:塑造对手学习

具有对手学习意识的学习 (LOLA) 是一种学习规则,它明确考虑了一个智能体当前策略对其他智能体将如何更新其参数的影响。与将对手视为环境的一部分不同,LOLA 智能体会预测对手未来的参数更新,并优化自身策略以塑造该学习过程。

关键的技术实现细节包括:

  • 参数更新规则: LOLA 更新规则包含一个特定项,用于考虑一个智能体的策略对其他智能体预期参数更新的影响。
  • 可扩展性: LOLA 更新规则可以通过策略梯度估计器的扩展高效计算。这使得该方法适用于无模型 RL,使其能够扩展到大参数空间、大输入空间以及非线性函数逼近器。

性能与结果

OpenAI 研究者应用 LOLA 后,智能体在多个基准测试中表现出卓越性能:

  • 囚徒困境的迭代版本(IPD): 在两个 LOLA 智能体相遇时,出现了以牙还牙策略和合作的出现,而独立学习的智能体未能做到这一点。LOLA 智能体相比天真的学习者获得了更高的回报,并且对高阶基于梯度的方法的利用具有鲁棒性。
  • 重复匹配便士: 在此零和博弈中,LOLA 智能体收敛到纳什均衡。
  • 循环赛锦标赛: 在对现有文献中多智能体学习算法范围的循环赛锦标赛中,LOLA 智能体在 IPD 上获得了最高的平均回报。
  • 网格世界任务: 在一个包含嵌入式社会困境的网格世界任务中,LOLA 智能体使用循环策略和对手建模,学会基于自身利益进行合作。

对多智能体系统的影响

通过明确考虑其他智能体的学习,LOLA 为智能体提供了一种机制,使其能够在个体自利通常导致次优结果的环境中学习合作。这种方法将智能体的视角从对当前策略的反应转移到影响同一对手未来学习轨迹上。

Sources