Ronchy2000/Multi-agent-RL
Projects from basic algorithms to MARL. Implements MADDPG,MATD3,MA/HAPPO in Predator-Prey pursuit games with PettingZoo MPE environments.
何を解決するか
このリポジトリは、強化学習(RL)およびマルチエージェント強化学習(MARL)の構造的な学習パスと実装コレクションを提供します。特に、基本的な単一エージェントRLアルゴリズムから、連続的アクション空間における追跡回避ゲーム(捕食者-獲物)のような複雑なマルチエージェントシナリオへの移行という課題に取り組んでいます。
仕組み
プロジェクトはモジュールの段階的な進行として構成されています:
- 基本的なRL:価値反復、方策反復、モンテカルロ法、時系列差分法、DQN、REINFORCEの実装。
- 高度な単一エージェントRL:Actor-CriticおよびDDPGの実装。
- マルチエージェントRL:PettingZoo MPEフレームワークを用いて単一エージェントアルゴリズムをマルチエージェント環境に拡張し、MADDPG、MATD3(二重Qネットワークと遅延更新を用いて過大評価を低減)、MAPPO/HAPPO(確率的方策と観測次元が異なる異種エージェントをサポート)の実装を含みます。
対象読者
- 強化学習およびマルチエージェントシステムを研究・学習する研究者や学生。
- 連続的アクション空間向けのMARLアルゴリズムの具体的なPyTorch実装を探している開発者。
- 追跡回避ゲームのシミュレーションやスウォームインテリジェンスに興味があるユーザー。
特徴
- 包括的な学習パス:基本的な数学的基盤から高度なMARLまでをカバー。
- 多様なMARLアルゴリズム:MADDPG、MATD3、HAPPO/MAPPOを含む。
- 異種エージェント対応:HAPPO実装は、異なる能力や観測次元を持つエージェントをサポート。
- 追跡回避ゲーム最適化:PettingZooを用いて捕食者-獲物タスクに特化して調整済み。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト