DLR-RM/stable-baselines3
PyTorch version of Stable Baselines, reliable implementations of reinforcement learning algorithms.
解決的問題
Stable Baselines3 (SB3) 提供一組可靠、經過測試且標準化的強化學習(RL)演算法實作。它消除了研究人員與開發者從頭實作這些演算法的需要,為重現、改良與比較不同 RL 方法提供一致的基準。
如何運作
SB3 基於 PyTorch 建構,並採用類似 scikit-learn 的語法,使 RL 演算法更易於使用。使用者只需定義一個策略與一個環境(例如 Gymnasium 中的環境),然後使用簡單的 .learn() 方法即可訓練智能體。該套件支援多種動作與觀察空間(包含 Dict 觀察空間),並可與 Tensorboard 集成以進行監控,以及與 Weights & Biases 集成以追蹤實驗。
適用對象
專為具備基本強化學習知識的研究人員、產業專業人士與初學者設計,幫助他們無需陷入實作細節,即可使用穩定的工具組來建構 RL 專案。
主要特色
- 標準化演算法:實作先進的 RL 方法,如 PPO、DQN、SAC 與 TD3。
- 一致的介面:所有演算法使用統一介面,方便使用。
- 可擴展性:支援自訂環境、自訂策略與自訂回呼(callback)。
- 廣泛相容性:相容 Gymnasium 環境,支援多進程以加快訓練速度。
- 生態系統:屬於更大的生態系統,包含 RL Baselines3 Zoo(用於訓練與超參數調校)與 SB3-Contrib(用於實驗性功能)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案