OpenAI 在深度強化學習中進行安全探索基準測試

TL;DR

OpenAI 推出了 Safety Gym 基準測試套件,將受限強化學習 (RL) 標準化為安全探索的主要形式化方法。這讓研究人員能夠衡量開發 RL 代理在開發過程中,如何在不違反高維度連續控制環境中關鍵安全約束的情況下,透過試錯來學習最佳策略的進展。

將受限 RL 標準化以進行安全探索

對於與現實世界互動的 RL 代理而言,安全探索至關重要,特別是在與人類互動的機器人系統中,某些錯誤是不可接受的。雖然目前大多數 RL 代理是在模擬中訓練的,但 OpenAI 主張,向直接在現實世界中訓練代理的轉變將需要更穩健的安全方法。

OpenAI 建議將受限 RL 作為安全探索的主要形式化方法。受限 RL 允許代理在遵守特定安全約束的集的同時學習最佳策略,確保代理在學習的探索階段不會從事不可接受的行為。

Safety Gym 基準測試套件

為了衡量受限 RL 的研究進展,OpenAI 發布了 Safety Gym 基準測試套件。Safety Gym 提供了一系列全新的高維度連續控制環境,專門設計用於測試代理在實現其目標的同時維持安全約束的能力。

這些環境是模擬環境,提供了一個高維度連續控制問題,其任務與典型的 RL 環境相同——最大化獎勵——但必須由同一代理遵循一組約束。

為未來研究建立基準線

OpenAI 已在 Safety Gym 環境中對幾種受限深度 RL 演算法進行了基準測試,以建立基準線。透過提供這些基準測試,OpenAI 為安全探索和安全強化學習領域的未來研究提供了基準線。

Sources