OpenAI 在深度强化学习中对安全探索进行基准测试
TL;DR
OpenAI 推出了 Safety Gym 基准测试套件,旨在将受限强化学习 (RL) 标准化为安全探索的主要形式化方法。这使得研究人员能够衡量在开发 RL 智能体方面的进展,这些智能体可以在高维连续控制环境中通过试错学习最优策略,而不会违反关键的安全约束。
将受限 RL 标准化以实现安全探索
对于与现实世界交互的 RL 智能体而言,安全探索至关重要,特别是在与人类互动的机器人系统中,其中某些错误是不可接受的。虽然目前大多数 RL 智能体是在模拟环境中训练的,但 OpenAI 认为,向直接在现实世界中训练智能体的转变将需要一种更稳健的安全方法。
OpenAI 建议将受限 RL 作为安全探索的主要形式化方法。受限 RL 允许智能体在遵守特定的一组安全约束的同时学习最优策略,从而确保智能体在学习的探索阶段不会从事不可接受的行为。
Safety Gym 基准测试套件
为了衡量受限 RL 的研究进展,OpenAI 发布了 Safety Gym 基准测试套件。Safety Gym 提供了一系列全新的高维连续控制环境,专门设计用于测试智能体在实现目标的同时维持安全约束的能力。
这些环境是模拟环境,提供了一个高维连续控制问题,其任务与典型的 RL 环境相同——最大化奖励——但必须由同一个智能体遵守一组约束。
为未来研究建立基准
OpenAI 已在 Safety Gym 环境上对几种受限深度 RL 算法进行了基准测试,以建立基准。通过提供这些基准,OpenAI 为该领域内安全探索和安全强化学习的未来研究提供了基准。