Ronchy2000/Multi-agent-RL

Projects from basic algorithms to MARL. Implements MADDPG,MATD3,MA/HAPPO in Predator-Prey pursuit games with PettingZoo MPE environments.

解决的问题

本仓库提供了一个结构化的学习路径和强化学习(RL)与多智能体强化学习(MARL)的实现集合。它特别解决了从基础单智能体RL算法向复杂多智能体场景(如连续动作空间中的追捕-逃避游戏(捕食者-猎物))过渡的挑战。

工作原理

该项目按模块逐步推进组织:

  • 基础RL:价值迭代、策略迭代、蒙特卡洛、时序差分、DQN、REINFORCE的实现。
  • 高级单智能体RL:Actor-Critic和DDPG的实现。
  • 多智能体RL:基于PettingZoo MPE框架,将单智能体算法扩展到多智能体环境,包含MADDPG、MATD3(使用双Q网络和延迟更新以减少过估计)、MAPPO/HAPPO(支持随机策略和观测维度不同的异构智能体)的实现。

适用人群

  • 研究和学习强化学习与多智能体系统的研究人员和学生。
  • 寻找连续动作空间下MARL算法具体PyTorch实现的开发者。
  • 对追捕-逃避游戏模拟和群体智能感兴趣的用户。

亮点

  • 全面的学习路径:涵盖从基础数学原理到高级MARL的完整旅程。
  • 多样化的MARL算法:包含MADDPG、MATD3和HAPPO/MAPPO。
  • 异构支持:HAPPO实现支持具有不同能力与观测维度的智能体。
  • 专为追捕-逃避优化:特别针对使用PettingZoo的捕食者-猎物任务进行调优。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目