Farama-Foundation/MPE2

A set of communication oriented environments

해결하는 문제

MPE2는 다중 에이전트 강화학습(MARL) 알고리즘의 훈련 및 테스트를 위한 통신 중심의 시뮬레이션 환경 세트를 제공합니다. 협력적 및 적대적 환경에서 에이전트가 작업을 해결하기 위해 상호작용, 소통, 협력하는 것을 배워야 하는 표준화되고 가벼운 환경의 필요성을 충족시킵니다.

작동 방식

이 프로젝트는 에이전트가 원으로 표현되며, 다른 에이전트를 보고 정적 랜드마크와 상호작용할 수 있는 '입자' 환경의 시리즈를 구현합니다. 이는 이산(기본값) 및 연속 행동 공간을 모두 지원하여, 에이전트가 기본 방향으로 이동하거나 통신 채널을 통해 메시지를 브로드캐스트할 수 있도록 합니다. 시스템은 위치, 속도, 수신한 메시지 등의 관측값과 목표 달성(예: 물체 밀기, 다른 에이전트 태그하기)에 따라 보상을 추적합니다.

대상 사용자

다중 에이전트 AI 연구자 및 개발자에게 적합하며, 특히 강화학습에서의 탄생적 소통, 협력, 경쟁/협력 게임 이론에 초점을 맞추고 있는 분들께 적합합니다.

주요 특징

  • 다양한 상호작용 모델: 협력 환경(예: Simple Spread, Simple Formation)과 적대적 환경(예: Simple Tag, Simple Push)을 포함합니다.
  • 유연한 행동 공간: 이동 및 통신에 대해 이산 및 연속 제어를 모두 지원합니다.
  • 통신 채널: 행동 조정을 위해 메시지를 브로드캐스트하고 수신할 수 있는 내장 메커니즘을 제공합니다.
  • 개선된 안정성: OpenAI의 원본 MPE를 기반으로 하지만, 보상 일관성 및 이산 행동 공간 기본값에 대한 수정이 적용되었습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트