Farama-Foundation/MPE2
A set of communication oriented environments
解决的问题
MPE2 提供了一组通信导向的仿真环境,用于训练和测试多智能体强化学习(MARL)算法。它解决了在合作与对抗场景中,智能体需要学习相互作用、通信和协调以完成任务的标准化、轻量级环境的需求。
工作原理
该项目实现了一系列“粒子”环境,其中智能体以圆形表示,能够移动、观察其他智能体,并与静态地标互动。它支持离散(默认)和连续动作空间,允许智能体控制其在基本方向上的移动或通过通信通道广播消息。系统会跟踪观测值(位置、速度和接收到的消息)以及基于智能体达成目标(如推动物体或标记其他智能体)的成功程度的奖励。
适用人群
专为从事多智能体人工智能的研究人员和开发者设计,特别是那些专注于强化学习中的涌现通信、协调以及竞争/合作博弈论的人员。
主要亮点
- 多样化的交互模型:包含合作环境(如 Simple Spread、Simple Formation)和对抗环境(如 Simple Tag、Simple Push)。
- 灵活的动作空间:支持移动和通信的离散与连续控制。
- 通信通道:内置机制,使智能体能够广播和接收消息以协调行动。
- 改进的稳定性:基于 OpenAI 原始 MPE,但修复了奖励一致性问题和离散动作空间的默认设置。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目