OpenAI Retro 竞赛与 Gym Retro 发布

OpenAI 发起了 Retro 竞赛并发布了 Gym Retro,旨在将强化学习(RL)研究从记忆转向泛化。该竞赛评估算法将知识从训练关卡迁移到先前未见的视频游戏关卡的能力。

Retro 竞赛:测试强化学习的泛化能力

Retro 竞赛衡量强化学习算法是否能够从已有经验中实现泛化,而不是仅仅记忆特定环境。在传统的强化学习研究中,算法通常在其训练时使用的相同环境中进行测试,这有利于那些拥有大量超参数、擅长记忆的模型。

竞赛结构与约束

  • Task: 为代理提供来自 Sonic The Hedgehog 系列的训练关卡集合,并在专为本竞赛创建的自定义测试关卡上进行评估。
  • Timeline: 竞赛时间为 4 月 5 日至 6 月 5 日。
  • Training Budget: 虽然训练期间可以使用任何环境或数据集,但每个未见的测试关卡的训练时间限制约为 18 小时(100 万时间步)。

性能基准

基线结果表明,强化学习算法的表现显著逊于人类。人类仅玩一小时即可获得远高于在测试关卡上使用 18 小时进行训练的强化学习算法的分数,即使这些算法采用了迁移学习。

OpenAI 发布了一篇技术报告《Gotta Learn Fast: A New Benchmark for Generalization in RL》,对多种算法进行了比较:

  • PPO(近端策略优化):当网络先在训练关卡上进行预训练再在测试关卡上微调时,性能几乎翻倍,展示了迁移学习的可靠效果。
  • Rainbow DQN:作为基线包含在内。
  • JERK:一种针对 Sonic 优化的随机猜测算法,随着训练进行会更频繁地重放得分最高的动作序列。

Gym Retro:全新的强化学习环境平台

Gym Retro 是一个将经典视频游戏封装为强化学习环境的系统,扩展了可用于研究的游戏的复杂性和多样性,超越了 Atari 2600。

技术能力与范围

  • Game Library: 初始版本包含 30 款 SEGA Genesis 游戏(来自 SEGA Mega Drive 与 Genesis Classics Steam 捆绑包)以及来自 Arcade Learning Environment 的 62 款 Atari 2600 游戏。
  • Hardware Advantages: 由于硬件更强大,SEGA Genesis 游戏比 Atari 游戏更为复杂,拥有超过 500 倍的内存、更丰富的控制输入以及更好的图形表现。
  • Generalization Potential: Genesis 游戏的关卡通常共享物理规则和对象外观,但在布局和道具上有所不同,这使其成为测试迁移学习的理想平台。

相较于以往实现的改进

  • Flexibility: 与需要 C++ 代码定义环境的 RLE 不同,Gym Retro 使用 JSON 文件,简化了新游戏的集成。
  • Reliability: Gym Retro 解决了 Universe 项目中的问题,该项目曾因异步环境、实时约束以及基于屏幕的游戏状态检测不可靠而频繁失败。

为研究者提供的支持资源

为方便参与和开发,OpenAI 提供了多种工具:

  • Retro-baselines:一个 GitHub 仓库,展示如何在竞赛任务上运行各种强化学习算法。
  • Sonic Recordings:一套人类通关 Sonic 关卡的录音数据集。它们使代理能够从关卡的随机位置开始,探索平时可能达不到的区域,或通过模仿学习进行训练。
  • Technical Report:详细的基准数据和结果可在随附的《Gotta Learn Fast》论文中查阅。

Sources