DLR-RM/stable-baselines3

PyTorch version of Stable Baselines, reliable implementations of reinforcement learning algorithms.

解決的問題

Stable Baselines3 (SB3) 提供一組可靠、經過測試且標準化的強化學習(RL)演算法實作。它消除了研究人員與開發者從頭實作這些演算法的需要,為重現、改良與比較不同 RL 方法提供一致的基準。

如何運作

SB3 基於 PyTorch 建構,並採用類似 scikit-learn 的語法,使 RL 演算法更易於使用。使用者只需定義一個策略與一個環境(例如 Gymnasium 中的環境),然後使用簡單的 .learn() 方法即可訓練智能體。該套件支援多種動作與觀察空間(包含 Dict 觀察空間),並可與 Tensorboard 集成以進行監控,以及與 Weights & Biases 集成以追蹤實驗。

適用對象

專為具備基本強化學習知識的研究人員、產業專業人士與初學者設計,幫助他們無需陷入實作細節,即可使用穩定的工具組來建構 RL 專案。

主要特色

  • 標準化演算法:實作先進的 RL 方法,如 PPO、DQN、SAC 與 TD3。
  • 一致的介面:所有演算法使用統一介面,方便使用。
  • 可擴展性:支援自訂環境、自訂策略與自訂回呼(callback)。
  • 廣泛相容性:相容 Gymnasium 環境,支援多進程以加快訓練速度。
  • 生態系統:屬於更大的生態系統,包含 RL Baselines3 Zoo(用於訓練與超參數調校)與 SB3-Contrib(用於實驗性功能)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案