随机神经网络用于层次强化学习

OpenAI 提出了一种通用的层次强化学习(HRL)框架,该框架利用随机神经网络来预训练多样化的技能集合,然后利用这些技能来加速下游任务的学习。该方法专门解决了稀疏奖励和长 horizon 任务的挑战,在这些任务中,传统的深度强化学习往往难以有效探索。

通过随机神经网络进行技能预训练

该框架的核心是一个预训练阶段,在这一阶段,智能体在预训练环境中学习有用的技能。为了高效地学习广泛的可解释技能,研究者采用了结合信息论正则化器的随机神经网络。

此预训练过程由单一代理奖励引导,该奖励仅需了解即将面临的特定下游任务的最小领域知识。通过使用信息论正则化器,系统确保所学习的技能具有区分性并覆盖广泛的行为。

层次学习架构

该框架基于层次结构运作,以提高探索和样本效率:

  1. 技能获取:智能体首先在预训练阶段使用随机神经网络架构学习一套技能库。
  2. 高层策略训练:在获得技能后,在已有技能之上训练高层策略。高层策略不学习原始动作,而是从已学习的技能中选择以实现目标。

这种层次结构使得智能体能够更有效地应对下游任务中的稀疏奖励,因为高层策略可以使用复杂而有意义的行为(技能)来探索环境,而不是依赖随机的原始动作。

性能与影响

实验表明,随机神经网络与信息论正则化的结合在以样本高效的方式学习可解释技能方面是有效的。研究者发现,这种方法在广泛的下游任务中均匀地显著提升了学习性能。

通过结合内在动机和层次方法的优势,此框架提供了一种可扩展的方式来学习复杂行为,而无需为每个新任务进行大量手动奖励函数工程。

Sources