OpenAI Procgen and MineRL 竞赛

OpenAI 与 AIcrowd、卡内基梅隆大学和 DeepMind 合作,正在为 NeurIPS 2020 共同组织两项竞赛。这些竞赛利用 Procgen Benchmark 和 MineRL,挑战研究社区提高强化学习 (RL) 的样本效率和泛化能力。

Procgen 竞赛:提高泛化能力和样本效率

Procgen 竞赛旨在通过在多样化的环境集中使用固定数量的环境交互,来最大化智能体的性能。这种方法旨在测试智能体泛化到未见情况的能力,并提高其样本效率。

评估指标与环境

智能体将在 16 个公开发布的 Procgen Benchmark 环境以及为本次竞赛专门创建的四个秘密测试环境中接受评估。通过汇总这些多样化设置下的性能,组织者提供了高质量的指标来判断底层算法。

为易用性而设计

由于 Procgen 环境是程序化生成的,它们本质上要求智能体泛化到新情况。这些环境旨在快速且易于使用,允许计算资源有限的参与者复现基准结果并快速迭代新方法。

MineRL 竞赛:利用人类演示

MineRL 2020 竞赛专注于开发能够高效利用人类演示来解决复杂、层级化且稀疏环境的算法。这是为了应对这样一个事实:许多最先进的 RL 系统(例如 AlphaStar 和 OpenAI Five)需要指数级增长的计算量和模拟器样本,这使得它们难以应用于样本成本高昂的现实世界问题。

技术约束与目标

参与者必须开发能够从原始像素中在 Minecraft 中获得钻石的系统。竞赛施加了严格的约束,以确保开发出真正具有样本效率的算法:

  • 样本限制: 仅限从 MineRL 模拟器中获取 8,000,000 个样本。
  • 计算限制: 在单台 GPU 机器上进行 4 天的训练。
  • 数据来源: 为参与者提供 MineRL-v0 数据集,其中包含超过 6000 万帧的人类演示。

与标准 RL 的比较

继 MineRL 2019 竞赛(其中顶尖智能体获得了铁镐)之后,2020 年的挑战进一步推动了技术水平。虽然标准的 RL 系统通常需要在大型多 GPU 系统上进行数亿次环境交互才能实现类似目标,但 MineRL 竞赛的约束迫使人们依赖专家轨迹来最大限度地减少模拟器交互。

验证与防过拟合措施

为了防止特征工程或对领域的过拟合,MineRL 竞赛组织者将使用相同的严格硬件、计算和模拟器交互约束,从头开始训练顶尖团队的最终轮模型。

Sources