PKU-Alignment/safety-gymnasium
NeurIPS 2023: Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark
解決的問題
Safety-Gymnasium 提供一個標準化、可擴展且可客製化的安全強化學習(SafeRL)基準。它解決了需要統一環境集以評估 SafeRL 算法的需求,取代了那些缺乏向量化環境、現代 Gym API 或視覺輸入支援的舊版套件。
工作原理
基於 MuJoCo(2.3.0+)建構,該套件移除了對舊版 mujoco-py 的依賴,並實現了一系列增強安全性的學習任務。它提供標準 API,包含約束資訊,使智能體在遵守安全要求的同時學習任務。該套件支援多種模態,包括基於狀態與基於視覺的輸入,並包含單智能體、多智能體以及 Isaac Gym 模擬的環境。
適用對象
專為需要可靠、現代基準來測試與比較其演算法效能與安全性的安全強化學習研究人員與開發者設計。
主要亮點
- 廣泛的環境套件:包含安全導航(Goal、Button、Push、Circle)、安全速度、安全視覺、安全多智能體以及 Safe Isaac Gym 的任務。
- 現代化基礎設施:支援向量化環境,並與新版 Gym API(0.26.0+)相容。
- 多樣化的智能體:支援多種智能體類型,包括 Point、Car、Doggo、Racecar、Ant,以及其他如 HalfCheetah 和 Humanoid 等。
- 提升的穩定性:重新設計原始的 Safety-Gym,修復錯誤並移除過時的相依性。
相關
- 專案
- 專案
- 專案
- 專案
- 專案