DLR-RM/stable-baselines3

PyTorch version of Stable Baselines, reliable implementations of reinforcement learning algorithms.

何を解決するか

Stable Baselines3 (SB3) は、信頼性が高く、テスト済みで標準化された強化学習(RL)アルゴリズムの実装を提供します。研究者や開発者がこれらのアルゴリズムを再実装する必要がなくなり、異なるRLアプローチの再現、改善、比較に一貫した基準を提供します。

どう動くか

SB3 は PyTorch に基づき、scikit-learn に似た構文を採用して、RLアルゴリズムの利用を容易にしています。ユーザーはポリシーと環境(Gymnasium からのものなど)を定義し、シンプルな .learn() メソッドを使ってエージェントを学習できます。このライブラリはさまざまなアクション空間と観測空間(Dict 観測空間を含む)をサポートし、Tensorboard による監視やWeights & Biases による実験追跡と統合できます。

対象ユーザー

強化学習の基本的な知識を持つ研究者、業界の専門家、および初心者向けに設計されています。実装の詳細に巻き込まれることなく、安定したツールセットでRLプロジェクトを構築したい人におすすめです。

特徴

  • 標準化されたアルゴリズム: PPO、DQN、SAC、TD3 などの最先端RL手法を実装。
  • 一貫したインターフェース: すべてのアルゴリズムで共通のインターフェースを使用し、使いやすさを実現。
  • 拡張性: カスタム環境、カスタムポリシー、カスタムコールバックをサポート。
  • 広範な互換性: Gymnasium 環境と互換性があり、並列処理をサポートして学習を高速化。
  • エコシステム: RL Baselines3 Zoo(学習とハイパーパラメータチューニング用)と SB3-Contrib(実験的機能用)を含む、より大きなエコシステムの一環。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト