OpenAI 元学习用于摔跤

OpenAI 已经开发出一个用于模拟机器人摔跤的元学习代理,能够快速调整其策略以击败更强的对手并补偿物理故障。此能力使代理能够基于与新环境或对手的少量交互,实时优化其性能。

多智能体适应的修改版 MAML

OpenAI 将模型不可知元学习(MAML)算法扩展为针对环境对进行优化,而不是单个环境。虽然标准 MAML 初始化策略以便在最少参数更新的情况下快速适应新任务,但此修改版本使代理能够适应以前未见过的环境,前提是它们与之前的训练数据不会偏离太远。

在执行过程中,代理会对与新环境交互的前几个情节中收集到的奖励执行梯度上升步骤。此过程使代理能够实时优化其策略参数,以更好地应对特定对手。

实验设置与结果

为了测试持续适应,OpenAI 使用了形态各异的三种模拟代理类型:

  • 蚂蚁 (4条腿)
  • 虫子 (6条腿)
  • 蜘蛛 (8条腿)

这些代理在多轮游戏中竞争,他们与同一对手进行了几场比赛。元学习代理在轮次之间调整其策略参数以应对对手的特定策略。OpenAI 发现,能够调整策略的代理相比固定策略的代理表现出显著更高的成功率。

对物理故障的适应

除了适应外部对手之外,元学习方法使代理能够处理内部变化。OpenAI 演示了代理能够适应物理故障,例如它们自身某些肢体功能随时间的丧失。这表明元学习可用于开发能够同时应对外部环境变化以及自身内部状态或身体变化的代理。

可用性与研究背景

这项工作是 OpenAI 关于大规模多智能体系统更广泛研究的一部分。为了促进进一步实验,OpenAI 通过 GitHub 发布了研究中使用的 MuJoCo 环境和训练好的策略。

Sources

相关