OpenAI 深層強化学習における安全な探索のベンチマーク化
TL;DR
OpenAIは、安全な探索のための主要な形式手法として制約付き強化学習(RL)を標準化するため、Safety Gymベンチマークスイートを導入しました。これにより、研究者は、高次元の連続制御環境において、重要な安全制約に違反することなく試行錯誤を通じて最適な方策を学習できるRLエージェントの開発における進捗を測定できるようになります。
安全な探索のための制約付きRLの標準化
安全な探索は、現実世界と相互作用するRLエージェント、特に人間と相互作用するロボットシステムにおいて、特定の誤りが許容されない場合に極めて重要です。現在、ほとんどのRLエージェントはシミュレーション内でトレーニングされていますが、OpenAIは、エージェントを現実世界で直接トレーニングする方向への移行が、安全性へのより堅牢なアプローチを必要とすると主張しています。
OpenAIは、制約付きRLを安全な探索のための主要な形式手法として使用することを提案しています。制約付きRLにより、エージェントは特定の安全制約のセットに従いながら最適な方策を学習することができ、学習の探索フェーズにおいてエージェントが許容できない行動をとらないことを保証します。
Safety Gym ベンチマークスイート
制約付きRLの研究進捗を測定するために、OpenAIはSafety Gymベンチマークスイートをリリースしました。Safety Gymは、目標を達成しながら安全制約を維持するエージェントの能力をテストするために特別に設計された、一連の新しい高次元連続制御環境を提供します。
これらの環境は、シミュレーション環境であり、高次元の連続制御問題を提供します。そこでのタスクは一般的なRL環境と同じく報酬の最大化ですが、エージェントが従わなければならない一連の制約が伴います。
将来の研究のためのベースラインの確立
OpenAIは、ベースラインを確立するために、Safety Gym環境上でいくつかの制約付き深層RLアルゴリズムをベンチマーク化しました。これらのベンチマークを提供することで、OpenAIは、安全な探索および安全な強化学習という同じ分野における将来の研究のためのベースラインを提供します。