Stable-Baselines-Team/stable-baselines3-contrib
Contrib package for Stable-Baselines3 - Experimental reinforcement learning (RL) code
解决的问题
它为实验性强化学习(RL)算法和工具提供了一个专用空间,这些算法和工具过于小众或不够成熟,无法纳入主 Stable-Baselines3 库,同时仍保持高水平的文档和风格标准。
工作原理
作为 Stable-Baselines3 的贡献包,它实现了来自近期论文的各种 RL 算法,并提供了专用的环境包装器。它允许社区在无需满足核心库严格集成约束的情况下,贡献有用的工具和算法。
适用人群
需要访问 Stable-Baselines3 提供的标准算法之外更广泛实验性算法的强化学习研究人员和开发者。
主要亮点
- 实验性 RL 算法:包含 ARS、QR-DQN、MaskablePPO、RecurrentPPO(PPO LSTM)、TQC、TRPO 和 CrossQ 的实现。
- Gym 包装器:提供 Time Feature Wrapper 等专用工具。
- 一致的标准:保持与主 Stable-Baselines3 项目相同的风格和文档质量。
相关
- 项目
- 项目
- 项目
- 项目
- 项目