Farama-Foundation/MPE2

A set of communication oriented environments

解决的问题

MPE2 提供了一组通信导向的仿真环境,用于训练和测试多智能体强化学习(MARL)算法。它解决了在合作与对抗场景中,智能体需要学习相互作用、通信和协调以完成任务的标准化、轻量级环境的需求。

工作原理

该项目实现了一系列“粒子”环境,其中智能体以圆形表示,能够移动、观察其他智能体,并与静态地标互动。它支持离散(默认)和连续动作空间,允许智能体控制其在基本方向上的移动或通过通信通道广播消息。系统会跟踪观测值(位置、速度和接收到的消息)以及基于智能体达成目标(如推动物体或标记其他智能体)的成功程度的奖励。

适用人群

专为从事多智能体人工智能的研究人员和开发者设计,特别是那些专注于强化学习中的涌现通信、协调以及竞争/合作博弈论的人员。

主要亮点

  • 多样化的交互模型:包含合作环境(如 Simple Spread、Simple Formation)和对抗环境(如 Simple Tag、Simple Push)。
  • 灵活的动作空间:支持移动和通信的离散与连续控制。
  • 通信通道:内置机制,使智能体能够广播和接收消息以协调行动。
  • 改进的稳定性:基于 OpenAI 原始 MPE,但修复了奖励一致性问题和离散动作空间的默认设置。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目