Stable-Baselines-Team/stable-baselines3-contrib
Contrib package for Stable-Baselines3 - Experimental reinforcement learning (RL) code
해결하는 문제
Stable-Baselines3 메인 라이브러리에 포함하기에는 너무 특수하거나 성숙도가 낮은 실험적 강화학습(RL) 알고리즘과 도구를 전용 공간에서 제공하며, 문서화 및 스타일에 대해 높은 기준을 유지합니다.
작동 방식
Stable-Baselines3의 기여 패키지로서 최근 논문에서 제안된 다양한 RL 알고리즘을 구현하고, 특수한 환경 래퍼를 제공합니다. 이는 커뮤니티가 코어 라이브러리의 엄격한 통합 제약 없이 유용한 유틸리티와 알고리즘을 기여할 수 있도록 합니다.
대상 사용자
Stable-Baselines3가 제공하는 표준 알고리즘 외에도 더 넓은 범위의 실험적 알고리즘에 접근이 필요한 강화학습 연구자 및 개발자입니다.
주요 특징
- 실험적 RL 알고리즘: ARS, QR-DQN, MaskablePPO, RecurrentPPO(PPO LSTM), TQC, TRPO, CrossQ의 구현 포함.
- Gym 래퍼: Time Feature Wrapper와 같은 전용 도구 제공.
- 일관된 기준: 메인 Stable-Baselines3 프로젝트와 동일한 스타일과 문서 품질 유지.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트