OpenAI 变分选项发现算法

通过强化学习的变分自编码选项学习 (VALOR)

VALOR 是一种强化学习方法,源自变分选项发现与变分自编码器(VAEs)之间的紧密联系。在该框架中,智能体的策略充当编码器,将噪声分布中的上下文映射到特定轨迹。相反,解码器旨在从智能体生成的完整轨迹中恢复这些原始上下文。

选项稳定性的课程学习

为了解决变分选项发现中的训练不稳定性,OpenAI 提出了一种课程学习方法。当智能体在当前上下文集合上的表现足够强(由解码器衡量)时,才会增加智能体接触的上下文数量。

这种基于课程的方式提供了两个主要好处:

  • 训练稳定化:它稳定了 VALOR 以及其他现有变分选项发现方法的训练过程。
  • 行为多样性提升:它使单个智能体能够学习显著更多的行为模式,而这在使用固定上下文分布时是无法实现的。

研究范围

除了主要的算法贡献外,研究还探讨了通用变分选项发现方法的根本局限性,并检查了学习到的选项如何应用于下游任务。

SUMMARY: OpenAI 引入了通过强化学习的变分自编码选项学习 (VALOR) 和一种课程学习方法,以稳定强化学习智能体中多样行为模式的发现。

TITLE: OpenAI 变分选项发现算法

Sources