OpenAI 大规模好奇心驱动学习研究
OpenAI 发布了一项关于好奇心驱动学习的研究,展示了智能体能够在没有任何外部奖励的情况下学习复杂行为并解决环境。通过将预测误差用作内在奖励信号,这些智能体在好奇心驱动目标与传统手工设计的外部奖励之间表现出高度的一致性。
好奇心内在奖励信号
强化学习(RL)通常依赖人类设计的外部奖励来引导智能体的行为。然而,为每个环境创建密集的手工奖励并不可扩展。为了解决这个问题,研究团队开发了一种内在于智能体的奖励函数,其中好奇心被定义为智能体对环境内部模型的预测误差。
当智能体遇到其内部模型无法准确预测的状态或转移时,会获得奖励,从而鼓励其探索新颖或不熟悉的领域。
跨 54 个环境的大规模评估
OpenAI 在 54 个标准基准环境(包括 Atari 游戏套件)中进行了首次纯好奇心驱动学习的大规模研究。智能体在训练过程中没有任何外部奖励,即它们没有收到游戏得分或积分等信号。
结果显示出令人惊讶的良好表现,研究发现内在好奇心目标与这些游戏中通常使用的外部奖励之间具有高度的一致性。
特征空间与泛化
研究调查了用于计算预测误差的不同特征空间。研究发现:
- 随机特征: 这些对许多流行的强化学习游戏基准足够。
- 学习特征: 这些提供更好的泛化,尤其是在智能体需要在《超级马里奥兄弟》中导航新游戏关卡时。
随机环境中的局限性
虽然好奇心驱动学习在许多基准中取得成功,研究人员仍发现基于预测的奖励在随机(stochastic)环境下存在局限性。在转移本质上不可预测的环境中,智能体可能会被不可预测的环境所困住,而不是进行有意义的探索。
结论
该研究表明,在许多情况下,好奇心驱动学习可以有效取代外部奖励,并且在使用学习特征时,智能体对新关卡的泛化能力得到提升。然而,随机性带来的挑战仍是基于预测的内在奖励的主要限制因素。