Ronchy2000/Multi-agent-RL
Projects from basic algorithms to MARL. Implements MADDPG,MATD3,MA/HAPPO in Predator-Prey pursuit games with PettingZoo MPE environments.
해결하는 문제
이 저장소는 강화학습(RL) 및 다중 에이전트 강화학습(MARL)을 위한 체계적인 학습 경로와 구현 모음집을 제공합니다. 특히 연속적 행동 공간에서의 추적-회피 게임(Predator-Prey)과 같은 복잡한 다중 에이전트 시나리오로의 전환 과정에서 발생하는 도전 과제를 해결합니다.
작동 방식
프로젝트는 모듈 단위의 단계적 진행 구조로 구성되어 있습니다:
- 기본 RL: 가치 반복, 정책 반복, 몬테카를로, 시간차, DQN, REINFORCE의 구현.
- 고급 단일 에이전트 RL: Actor-Critic 및 DDPG의 구현.
- 다중 에이전트 RL: PettingZoo MPE 프레임워크를 활용해 단일 에이전트 알고리즘을 다중 에이전트 환경으로 확장하며, MADDPG, MATD3(이중 Q-네트워크와 지연 업데이트를 사용해 과대평가를 줄임), MAPPO/HAPPO(확률적 정책과 관측 차원이 다른 이질적 에이전트를 지원)의 구현을 포함합니다.
대상 사용자
- 강화학습과 다중 에이전트 시스템을 연구하거나 학습하는 연구자 및 학생.
- 연속적 행동 공간을 위한 MARL 알고리즘의 구체적인 PyTorch 구현을 찾는 개발자.
- 추적-회피 게임 시뮬레이션 및 군집 지능에 관심 있는 사용자.
주요 특징
- 포괄적인 학습 경로: 기본 수학적 기초에서 고급 MARL에 이르기까지 전반적인 여정을 커버.
- 다양한 MARL 알고리즘: MADDPG, MATD3, HAPPO/MAPPO 포함.
- 이질적 에이전트 지원: HAPPO 구현은 다양한 능력과 관측 차원을 가진 에이전트를 지원.
- 추적-회피 최적화: PettingZoo를 사용해 포식자-피식자 작업에 특화되어 설계됨.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트