Ronchy2000/Multi-agent-RL
Projects from basic algorithms to MARL. Implements MADDPG,MATD3,MA/HAPPO in Predator-Prey pursuit games with PettingZoo MPE environments.
解决的问题
本仓库提供了一个结构化的学习路径和强化学习(RL)与多智能体强化学习(MARL)的实现集合。它特别解决了从基础单智能体RL算法向复杂多智能体场景(如连续动作空间中的追捕-逃避游戏(捕食者-猎物))过渡的挑战。
工作原理
该项目按模块逐步推进组织:
- 基础RL:价值迭代、策略迭代、蒙特卡洛、时序差分、DQN、REINFORCE的实现。
- 高级单智能体RL:Actor-Critic和DDPG的实现。
- 多智能体RL:基于PettingZoo MPE框架,将单智能体算法扩展到多智能体环境,包含MADDPG、MATD3(使用双Q网络和延迟更新以减少过估计)、MAPPO/HAPPO(支持随机策略和观测维度不同的异构智能体)的实现。
适用人群
- 研究和学习强化学习与多智能体系统的研究人员和学生。
- 寻找连续动作空间下MARL算法具体PyTorch实现的开发者。
- 对追捕-逃避游戏模拟和群体智能感兴趣的用户。
亮点
- 全面的学习路径:涵盖从基础数学原理到高级MARL的完整旅程。
- 多样化的MARL算法:包含MADDPG、MATD3和HAPPO/MAPPO。
- 异构支持:HAPPO实现支持具有不同能力与观测维度的智能体。
- 专为追捕-逃避优化:特别针对使用PettingZoo的捕食者-猎物任务进行调优。
相关
- 项目
- 项目
- 项目
- 项目
- 项目