OpenAI Gym Beta 发布

OpenAI 已发布 OpenAI Gym 的公开测试版,这是一个用于开发和比较强化学习(RL)算法的工具包。此版本提供了一套标准化的环境以及一个用于复现和比较研究结果的平台,解决了 RL 基准测试中缺乏一致性和多样性的问题。

标准化强化学习基准

OpenAI Gym 旨在解决 RL 研究中的两个主要瓶颈:缺乏多样且易于使用的基准以及环境定义缺乏标准化。在监督学习中,进步受到像 ImageNet 这样的大型标注数据集的推动;OpenAI Gym 通过提供多样化的环境集合(从模拟机器人到 Atari 游戏)为 RL 提供类似的功能。

标准化至关重要,因为奖励函数或动作集合的细微变化可能会显著改变任务的难度。通过提供一致的环境集合,OpenAI Gym 使研究人员能够更准确地复现已发表的研究并在不同论文之间比较结果。

工具包功能与兼容性

OpenAI Gym 的设计旨在与框架无关,使其能够与任何框架编写的算法兼容,例如 TensorFlow 和 Theano。虽然目前的环境是用 Python 编写的,但 OpenAI 计划在未来使其可从其他编程语言访问。

评估与结果的方法

OpenAI Gym 避免使用传统排行榜,以防止过拟合或为特定任务创建手工制作的解决方案。相反,重点在于所开发技术的通用性。

为了跟踪进展,OpenAI 正在维护一个展示有趣算法能力的贡献精选列表。长期目标是让此精选过程成为社区驱动的工作,而不是由 OpenAI 拥有的集中式过程。

Sources