量化强化学习中的泛化

OpenAI 发布了 CoinRun,这是一种训练环境,旨在为智能体将经验推广到新情境的能力提供精确的度量。该环境解决了强化学习(RL)中长期存在的挑战,即智能体常常对训练环境的细节过拟合,而不是学习可推广的技能。

强化学习中的泛化挑战

深度强化学习算法常常难以将经验转移到新环境。虽然智能体能够解决复杂任务,但它们经常通过依赖特定的环境细节而产生过拟合。这一问题是更广泛模式的一部分:RL 智能体往往在与其训练时相同的环境上进行基准测试,研究人员将其比作监督学习中在训练集上进行测试。

先前尝试使用 Sonic 基准、程序化生成的网格世界迷宫以及 General Video Game AI 框架来解决此问题时,也表现出类似的过拟合模式。例如,在 Sonic 基准上训练的智能体在训练关卡上表现良好,但在未进行微调的测试关卡上表现不佳。

CoinRun 环境

CoinRun 是一种程序化生成的平台游戏环境,设计上比 Sonic the Hedgehog 等复杂游戏更易处理,同时仍然提供显著的泛化挑战。

规则与目标

  • Goal: 智能体必须收集位于关卡末端的单枚硬币。
  • Obstacles: 关卡包含静止和非静止障碍物;碰到任何障碍物都会立即死亡。
  • Reward Structure: 仅在收集硬币时授予固定的正向常数奖励。
  • Termination: 当智能体死亡、收集硬币或达到 1,000 步时,回合结束。

评估泛化性能

OpenAI 使用 Proximal Policy Optimization (PPO) 对九个智能体进行了 2.56 亿时间步的评估。八个智能体在固定规模的关卡集合(从 100 到 16,000)上进行训练,而一个智能体在无限制的关卡集合上训练,且从未遇到过相同的关卡两次。

过拟合的关键发现

  • Data Volume: 当训练关卡少于 4,000 时会出现显著的过拟合。即使在 16,000 关卡的训练下,过拟合仍然存在。
  • Optimal Performance: 使用无限制关卡集进行训练的智能体表现最佳,因为它们获取了最多的数据(约 200 万个不同的关卡)。
  • Architecture Impact: 使用 IMPALA-CNN 架构的智能体在所有训练集规模下的泛化能力显著优于使用 Nature-CNN 基线的智能体。

改进泛化的技术

使用固定的 500 关卡训练集,OpenAI 调查了几种正则化技术以缩小泛化差距:

  • Environmental Stochasticity: 该技术在所有测试方法中对泛化的提升幅度最大。
  • Data Augmentation and Batch Normalization: 两者均显著提升了泛化性能。
  • L2 Regularization and Dropout: 两者均缩小了泛化差距,其中 L2 正则化的影响更为显著。

扩展:CoinRun-Platforms 与 RandomMazes

为进一步研究过拟合,OpenAI 开发了两个额外环境:

  • CoinRun-Platforms: 该变体要求智能体在更大、固定大小的关卡中收集散布在平台上的多个硬币,需要更积极的探索和记忆。
  • RandomMazes: 一个简单的迷宫导航环境。

在两种情况下,智能体都表现出强烈的过拟合。在 RandomMazes 中,即使在 20,000 关卡的训练下,仍然存在显著的泛化差距,这需要使用 IMPALA-CNN 架构并在其后接入 LSTM 以提供记忆能力。

未来研究方向

OpenAI 提出三个主要方向以推动 RL 泛化研究:

  1. 探讨环境复杂度与实现有效泛化所需关卡数量之间的关系。
  2. 确定不同的循环结构是否更适合泛化。
  3. 探索将不同正则化方法组合的最有效方式。

Sources