OpenAI Safety Gym リリース

OpenAIは、学習中に安全制約を遵守できる強化学習(RL)エージェントの進捗を測定するための環境とツールのスイートであるSafety Gymをリリースしました。このリリースは、学習プロセス中にコストのかかるミスをいかに効果的に回避できるかをアルゴリズム間で比較するための標準化された手法を提供します。これは、実世界のロボティクスやインターネットベースのタスクにRLを導入する際に極めて重要です。

強化学習における探索のリスク

強化学習エージェントは、試行錯誤を通じて最適な行動を学習します。このプロセスは探索として知られています。しかし、探索は根本的にリスクを伴います。なぜなら、エージェントが回避方法を学ぶ前に、許容できないエラーにつながる危険な行動を試みる可能性があるからです。例えば、工場の自律型ロボットアームは、学習の初期段階でランダムに動き回り、近くの作業員に安全上のリスクをもたらす可能性があります。

制限された環境では、単純な物理的障壁や緊急停止装置によってリスクを軽減できるかもしれませんが、多様な条件下で動作する一般的なRLシステムには、安全な探索のためのより堅牢なアルゴリズム的アプローチが必要です。

定式化としての制約付き強化学習

安全な探索の問題に対処するため、OpenAIは制約付き強化学習の定式化を採用しました。エージェントが報酬関数を最大化することのみを追求する標準的なRLとは異なり、制約付きRLは、エージェントが制約しなければならないコスト関数を導入します。

報酬関数 vs. コスト関数

標準的なRLでは、安全性は報酬関数にペナルティを組み込むことで扱われることが多いです。しかし、このアプローチには問題があります。報酬の設計は困難であり、タスク完了の報酬が十分に高ければ、エージェントは総リターンを最大化するために頻繁な衝突や危険な行動を受け入れてしまう可能性があるからです。

制約付きRLでは、開発者は学習の開始時に許容可能なコスト率(例:許容可能な衝突率)を指定します。アルゴリズムは、エージェントがその特定の安全要件を満たすまでペナルティ(「コスト罰金」)を調整します。これにより、システムは恣意的なトレードオフではなく、結果を優先させることが可能になります。

Safety Gym 環境とツール

Safety Gymは、ロボットが特定のタスクを達成するために乱雑な空間をナビゲートしなければならない、多様な環境セットを提供します。このスイートには、3種類のロボットタイプ、3つの主要なタスク、および各タスクに対する2つの難易度レベルが含まれています。

ロボット構成

  • Point: 回転、前進/後退のためのアクチュエータを備えたシンプルな2Dロボットで、押し出しタスク用の小さな正方形が特徴です。
  • Car: 2つの独立して駆動する並列ホイールと、自由回転する後輪を備えたロボットで、移動のために調整されたアクチュエータ制御を必要とします。
  • Doggo: 左右対称の四肢を持つ四足歩行ロボットで、股関節の回旋、仰角、および膝の角度を制御します。

タスクタイプ

  • Goal: ロボットは一連の目標位置へ移動しなければなりません。
  • Button: ロボットは一連の目標ボタンを押さなければなりません。
  • Push: ロボットは箱を目標位置へ移動させなければなりません。

これらの環境では、障害物に衝突することは「不安全な行動」と定義され、赤い警告灯が点灯し、タスク報酬とは別のコストが発生します。

ベンチマークと予備的な結果

OpenAIは、Safety Gymベンチマークスイートを使用して、PPO、TRPO、Lagrangian penalized versions of PPO and TRPO、およびConstrained Policy Optimization (CPO)を含む、いくつかの標準的なRLおよび制約付きRLアルゴリズムを評価しました。

予備的な結果は、環境によって難易度が大きく異なり、解決しやすいものもあれば、現在の技術では難しすぎるものもあることを示しています。特筆すべき点として、OpenAIは、Lagrangian法がCPOよりも驚くほど優れた性能を示したことを発見しました。これは、この分野におけるこれまでの知見と矛盾する結果です。

再現性をサポートするために、OpenAIはSafety Starter Agentsリポジトリを介してアルゴリズムのコードを公開しています。

将来の研究方向

OpenAIは、制約付きRLのさらなる洗練のために、3つの主要な領域を特定しました:

  1. 現在のSafety Gym環境内でのエージェントの性能向上。
  2. Safety Gymを使用して、分布のシフト(distributional shift)と安全な転移学習を調査すること。
  3. 制約付きRLを、報酬とコストを定義するための人間の好みを反映した暗黙的な仕様(implicit specifications)と統合すること。

OpenAIは、安全性の測定が、最終的には開発者の評価スキームに統合されたり、政府機関によってAIシステムの安全基準を作成するために使用されたりする可能性があることを示唆しています。

Sources