OpenAI RL²: 通过慢速强化学习实现快速强化学习

OpenAI 已宣布 RL²,这是一个框架,通过将强化学习(RL)过程视为从数据中学习的模型,使代理能够快速学习新任务。通过将 RL 算法编码到循环神经网络(RNN)的权重中,RL² 使代理能够在仅几次试验中适应新的、以前未见过的马尔可夫决策过程(MDP),模拟动物利用先前知识学习的能力。

RL² 框架:学习如何学习

RL² 旨在弥合深度强化学习对大量试验的需求与动物利用先前知识快速学习新任务的能力之间的差距。核心概念是使用一个 RNN 来表示典型强化学习算法所接收的相同信息——观察、动作、奖励和终止标志——作为输入。

该系统在两个层次上进行学习:

  • 慢速 RL: 使用通用的 RL 算法来训练 RNN 的权重。这个“慢速”过程发生在许多不同的环境(MDP)中,跨越网络自身的权重。
  • 快速 RL: RNN 的激活存储了状态的

Sources