OpenAI Safety Gym 發佈

OpenAI 已發佈 Safety Gym,這是一套用於衡量強化學習 (RL) 代理在訓練過程中遵守安全約束進度的環境與工具。此次發佈提供了一種標準化的方法來比較演算法,以確定它們在學習過程中避免代價高昂錯誤的有效程度,這對於在現實世界的機器人技術或基於網路的任務中部署 RL 至關重要。

強化學習中的探索風險

強化學習代理透過試錯法學習最佳行為,這個過程稱為探索。然而,探索從根本上來說是具有風險的,因為代理在學會避免危險行為之前,可能會嘗試導致不可接受錯誤的危險行為。例如,工廠中的自主機器人手臂在訓練初期可能會隨機揮動,對附近的工人造成安全風險。

雖然在受限環境中,簡單的物理屏障或緊急停機可以減輕風險,但在多樣化條件下運行的通用 RL 系統需要更穩健的演算法方法來進行安全探索。

受限強化學習作為一種形式化方法

為了應對安全探索問題,OpenAI 採用了受限強化學習 (constrained reinforcement learning) 的形式化方法。與標準 RL 不同,標準 RL 的代理僅尋求最大化獎勵函數,而受限 RL 則引入了代理必須約束的成本函數。

獎勵與成本函數

在標準 RL 中,安全通常是透過在獎勵函數中加入懲罰來處理的。這種方法是有問題的,因為獎勵設計很困難;如果完成任務的獎勵足夠高,代理可能會為了最大化總回報而接受頻繁的碰撞或危險行為。

在受限 RL 中,開發者在訓練開始時指定一個可接受的成本率(例如,可接受的碰撞率)。演算法接著會調整懲罰(「成本罰金」),直到代理滿足該特定的安全要求,從而允許系統優先考慮結果而非任意的權衡。

Safety Gym 環境與工具

Safety Gym 提供了一套多樣化的環境,機器人在其中必須在雜亂的空間中導航以完成特定任務。該套件包含三種機器人類型、三種主要任務以及每種任務的兩個難度等級。

機器人配置

  • Point: 一個簡單的 2D 機器人,具有用於轉向和前後移動的執行器,其特點是具有一個用於推動任務的小正方形。
  • Car: 一個具有兩個獨立驅動的平行輪胎和一個自由滾動後輪的機器人,需要協調的執行器控制來進行移動。
  • Doggo: 一個具有雙側對稱性的四足機器人,具有髖部方位角、仰角和膝蓋角度的控制。

任務類型

  • Goal: 機器人必須移動到一系列目標位置。
  • Button: 機器人必須按下系列目標按鈕。
  • Push: 機器人必須將箱子移動到一系列目標位置。

在這些環境中,撞到雜物被定義為不安全行為,會觸發紅色警告燈並產生與任務獎勵分開的成本。

基準測試與初步結果

OpenAI 使用 Safety Gym 基準測試套件評估了幾種標準 RL 和受限 RL 演算法,包括 PPO、TRPO、PPO 和 TRPO 的 Lagrangian 懲罰版本,以及 Constrained Policy Optimization (CPO)。

初步結果顯示,環境的難度差異很大,有些容易解決,而有些對於目前的技術來說太具挑戰性。值得注意的是,OpenAI 發現 Lagrangian 方法的表現出奇地優於 CPO,這與該領域先前的研究結果相矛盾。

為了支持可重複性,OpenAI 透過 Safety Starter Agents 儲存庫發佈了演算法程式碼。

未來研究方向

OpenAI 指出了受限 RL 進一步完善的三個主要領域:

  1. 改進代理在目前 Safety Gym 環境中的表現。
  2. 使用 Safety Gym 來研究分佈偏移 (distributional shift) 與安全遷移學習。
  3. 將受限 RL 與隱式規範(例如人類偏好)相結合,以定義獎勵與成本。

OpenAI 建議,安全衡量標準最終可以整合到開發者評估方案中,或由政府機構用於建立 AI 系統的安全標準。

Sources