PKU-Alignment/safety-gymnasium
NeurIPS 2023: Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark
何を解決するか
Safety-Gymnasium は、安全制約付き強化学習(SafeRL)のための標準化、スケーラブルでカスタマイズ可能なベンチマークを提供します。従来のライブラリがベクトル化された環境、現代的な Gym API、または視覚入力のサポートを欠いていたことに対応し、SafeRLアルゴリズムを評価するための一貫した環境セットの必要性を満たします。
仕組み
MuJoCo (2.3.0+) を基盤として構築され、レガシーな mujoco-py への依存を排除し、幅広い安全強化学習タスクを実装しています。制約に関する情報を含む標準 API を提供し、エージェントが安全要件を守りながらタスクを学習できるようにしています。状態ベースと視覚ベースの入力の両方をサポートし、単一エージェント、マルチエージェント、および Isaac Gym シミュレーション用の環境も含まれます。
対象ユーザー
安全強化学習に取り組む研究者や開発者向けです。最新で信頼性の高いベンチマークを必要とし、アルゴリズムの性能と安全性をテスト・比較できるように設計されています。
特徴
- 広範な環境セット: 安全なナビゲーション(Goal, Button, Push, Circle)、安全な速度、安全な視覚、安全なマルチエージェント、および Safe Isaac Gym 用のタスクを含みます。
- 現代的なインフラ: ベクトル化された環境をサポートし、新しい Gym API (0.26.0+) と互換性があります。
- 多様なエージェント: Point、Car、Doggo、Racecar、Ant など、HalfCheetah や Humanoid などの複数のエージェントタイプをサポートしています。
- 安定性の向上: 原始的な Safety-Gym を再設計し、バグを修正し、古くなった依存関係を削除しました。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト