PKU-Alignment/safety-gymnasium

NeurIPS 2023: Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark

해결하는 문제

Safety-Gymnasium은 안전 강화 학습(SafeRL)을 위한 표준화되고 확장 가능하며 사용자 정의 가능한 벤치마크를 제공합니다. 이전 라이브러리들이 벡터화된 환경, 최신 Gym API, 또는 시각 기반 입력을 지원하지 못했던 문제를 해결하며, SafeRL 알고리즘을 평가할 수 있는 통합된 환경 세트의 필요성을 충족시킵니다.

작동 방식

MuJoCo (2.3.0+) 기반으로 구축되어, 구식 mujoco-py 의존성을 제거하고 다양한 안전 강화 학습 작업을 구현합니다. 제약 조건 정보를 포함하는 표준 API를 제공하여 에이전트가 안전 요구 사항을 지키며 작업을 학습할 수 있도록 합니다. 상태 기반 및 시각 기반 입력을 포함한 다양한 모달리티를 지원하며, 단일 에이전트, 다중 에이전트, 그리고 Isaac Gym 시뮬레이션용 환경도 포함합니다.

대상 사용자

안전 강화 학습에 종사하는 연구자 및 개발자에게 적합합니다. 최신이고 신뢰할 수 있는 벤치마크를 필요로 하며, 알고리즘의 성능과 안전성을 테스트하고 비교할 수 있도록 설계되었습니다.

주요 특징

  • 다양한 환경 세트: 안전한 탐색(Goal, Button, Push, Circle), 안전한 속도, 안전한 시각, 안전한 다중 에이전트, Safe Isaac Gym용 작업 포함.
  • 현대적 인프라: 벡터화된 환경을 지원하며, 새로운 Gym API (0.26.0+) 와 호환됩니다.
  • 다양한 에이전트: Point, Car, Doggo, Racecar, Ant 등과 같은 다양한 에이전트 유형을 지원하며, HalfCheetah 및 Humanoid와 같은 다른 에이전트도 포함됩니다.
  • 개선된 안정성: 원본 Safety-Gym을 재설계하여 버그를 수정하고 오래된 종속성을 제거했습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트