OpenAI Safety Gym 发布
OpenAI 发布了 Safety Gym,这是一套用于衡量强化学习 (RL) 智能体在训练过程中遵守安全约束进展的环境和工具。此次发布提供了一种标准化的方法来比较算法,以确定它们在学习过程中避免代价高昂的错误的效果如何,这对于在现实世界的机器人技术或基于互联网的任务中部署 RL 至关重要。
强化学习中的探索风险
强化学习智能体通过试错来学习最佳行为,这一过程被称为探索。然而,探索从根本上说是具有风险的,因为智能体在学会避免危险行为之前,可能会尝试导致不可接受错误的危险行为。例如,工厂中的自主机器人手臂在训练初期可能会随机挥动,对附近的工人构成安全风险。
虽然在受限环境中,简单的物理屏障或紧急停机可以减轻风险,但在多样化条件下运行的通用 RL 系统需要更强大的算法方法来进行安全探索。
受约束强化学习作为一种形式化方法
为了解决安全探索问题,OpenAI 采用了受约束强化学习的形式化方法。与标准 RL 不同,标准 RL 中智能体仅寻求最大化奖励函数,而受约束 RL 引入了智能体必须约束的成本函数。
奖励与成本函数
在标准 RL 中,安全通常是通过在奖励函数中加入惩罚项来处理的。这种方法存在问题,因为奖励设计非常困难;如果完成任务的奖励足够高,智能体可能会为了最大化总回报而接受频繁的碰撞或危险行为。
在受约束 RL 中,开发者在训练开始时指定一个可接受的成本率(例如,可接受的碰撞率)。然后,算法会调整惩罚(“成本罚金”)直到智能体满足该特定的安全要求,从而允许系统优先考虑结果而非任意的权衡。
Safety Gym 环境与工具
Safety Gym 提供了一套多样化的环境,机器人必须在杂乱的空间中导航以完成特定任务。该套件包括三种机器人类型、三种主要任务以及每个任务的两个难度级别。
机器人配置
- Point: 一个简单的 2D 机器人,具有用于转向和前进/后退的执行器,其特征是一个用于推动任务的小正方形。
- Car: 一个具有两个独立驱动的平行轮和一个自由滚动的后轮的机器人,需要协调执行器控制来实现移动。
- Doggo: 一个具有双侧对称性的四足机器人,具有髋部方位角、仰角和膝盖角度的控制。
任务类型
- Goal: 机器人必须移动到一系列目标位置。
- Button: 机器人必须按下系列目标按钮。
- Push: 机器人必须将一个箱子移动到一系列目标位置。
在这些环境中,撞到杂物被定义为一种不安全行为,会触发红色警告灯并产生与任务奖励分开的成本。
基准测试与初步结果
OpenAI 使用 Safety Gym 基准测试套件评估了多种标准 RL 和受约束 RL 算法,包括 PPO、TRPO、PPO 和 TRPO 的 Lagrangian 惩罚版本,以及 Constrained Policy Optimization (CPO)。
初步结果表明,环境的难度差异很大,有些容易解决,而另一些对于当前技术来说过于具有挑战性。值得注意的是,OpenAI 发现 Lagrangian 方法的表现出人意料地优于 CPO,这与该领域之前的发现相矛盾。
为了支持可复现性,OpenAI 通过 Safety Starter Agents 仓库发布了算法代码。
未来研究方向
OpenAI 确定了进一步完善受约束 RL 的三个主要领域:
- 在当前的 Safety Gym 环境中提高智能体性能。
- 使用 Safety Gym 研究分布偏移和安全迁移学习。
- 将受约束 RL 与隐式规范(例如人类偏好)相结合,以定义奖励和成本。
OpenAI 建议,安全测量最终可以集成到开发人员评估方案中,或者由政府机构使用,以制定 AI 系统的安全标准。
Sources
- OriginalSafety Gym