Stable-Baselines-Team/stable-baselines3-contrib

Contrib package for Stable-Baselines3 - Experimental reinforcement learning (RL) code

何を解決するか

実験的な強化学習(RL)アルゴリズムや、メインの Stable-Baselines3 ライブラリに含めるにはあまりにニッチまたは未熟なツールを専用の場所で提供し、ドキュメントおよびスタイルの高い基準を維持します。

仕組み

Stable-Baselines3 の貢献パッケージとして機能し、最近の論文から得られた多様な RL アルゴリズムを実装し、特殊な環境ラッパーを提供します。これにより、コアライブラリの厳格な統合制約を必要とせずに、コミュニティが有用なユーティリティやアルゴリズムを貢献できるようになります。

対象ユーザー

Stable-Baselines3 が提供する標準的なアルゴリズムの範囲を超えて、より広範な実験的アルゴリズムにアクセスしたい強化学習に取り組む研究者や開発者。

主な特徴

  • 実験的 RL アルゴリズム: ARS、QR-DQN、MaskablePPO、RecurrentPPO(PPO LSTM)、TQC、TRPO、CrossQ の実装を含む。
  • Gym ラッパー: Time Feature Wrapper などの専用ツールを提供。
  • 一貫した基準: メインの Stable-Baselines3 プロジェクトと同様のスタイルとドキュメント品質を維持。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト