Ronchy2000/Multi-agent-RL

Projects from basic algorithms to MARL. Implements MADDPG,MATD3,MA/HAPPO in Predator-Prey pursuit games with PettingZoo MPE environments.

何を解決するか

このリポジトリは、強化学習(RL)およびマルチエージェント強化学習(MARL)の構造的な学習パスと実装コレクションを提供します。特に、基本的な単一エージェントRLアルゴリズムから、連続的アクション空間における追跡回避ゲーム(捕食者-獲物)のような複雑なマルチエージェントシナリオへの移行という課題に取り組んでいます。

仕組み

プロジェクトはモジュールの段階的な進行として構成されています:

  • 基本的なRL:価値反復、方策反復、モンテカルロ法、時系列差分法、DQN、REINFORCEの実装。
  • 高度な単一エージェントRL:Actor-CriticおよびDDPGの実装。
  • マルチエージェントRL:PettingZoo MPEフレームワークを用いて単一エージェントアルゴリズムをマルチエージェント環境に拡張し、MADDPG、MATD3(二重Qネットワークと遅延更新を用いて過大評価を低減)、MAPPO/HAPPO(確率的方策と観測次元が異なる異種エージェントをサポート)の実装を含みます。

対象読者

  • 強化学習およびマルチエージェントシステムを研究・学習する研究者や学生。
  • 連続的アクション空間向けのMARLアルゴリズムの具体的なPyTorch実装を探している開発者。
  • 追跡回避ゲームのシミュレーションやスウォームインテリジェンスに興味があるユーザー。

特徴

  • 包括的な学習パス:基本的な数学的基盤から高度なMARLまでをカバー。
  • 多様なMARLアルゴリズム:MADDPG、MATD3、HAPPO/MAPPOを含む。
  • 異種エージェント対応:HAPPO実装は、異なる能力や観測次元を持つエージェントをサポート。
  • 追跡回避ゲーム最適化:PettingZooを用いて捕食者-獲物タスクに特化して調整済み。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト