Stable-Baselines-Team/stable-baselines3-contrib

Contrib package for Stable-Baselines3 - Experimental reinforcement learning (RL) code

解決的問題

提供一個專用空間,用於實驗性強化學習(RL)演算法與工具,這些演算法與工具過於小眾或尚未成熟,無法納入主 Stable-Baselines3 庫,同時仍維持高水準的文件與風格標準。

如何運作

作為 Stable-Baselines3 的貢獻套件,實作來自近期論文的多種 RL 演算法,並提供專用的環境包裝器。讓社群能在不需符合核心庫嚴格整合限制的情況下,貢獻有用的工具與演算法。

適用對象

需要存取 Stable-Baselines3 提供標準演算法以外更廣泛實驗性演算法的強化學習研究人員與開發者。

主要特色

  • 實驗性 RL 演算法:包含 ARS、QR-DQN、MaskablePPO、RecurrentPPO(PPO LSTM)、TQC、TRPO 和 CrossQ 的實作。
  • Gym 包裝器:提供 Time Feature Wrapper 等專用工具。
  • 一致的標準:維持與主 Stable-Baselines3 項目相同的風格與文件品質。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案