instadeepai/Mava
🦁 A research-friendly codebase for fast experimentation of multi-agent reinforcement learning in JAX
해결하는 문제
Mava는 다중 에이전트 강화 학습(MARL)을 빠르게 실험해야 하는 연구자를 위해 설계되었습니다. GPU 및 TPU와 같은 하드웨어 가속기 전체에 걸쳐 확장할 수 있는 고성능 분산형 MARL 알고리즘 구현의 필요성을 해결하면서도, 빠른 반복 및 수정이 가능할 만큼 단순하게 유지됩니다.
작동 방식
JAX 기반으로 구축된 Mava는 단일 파일 구현을 사용하여 코드를 명확하고 접근하기 쉽게 유지합니다. 확장을 위해 두 가지 주요 분산 아키텍처를 지원합니다:
- Anakin: JAX로 작성된 환경에 사용되며, 최고 속도를 위해 전체 훈련 루프의 엔드투엔드 JIT 컴파일을 허용합니다.
- Sebulba: JAX로 작성되지 않은 환경에 사용되며, 하드웨어 가속기가 여러 CPU 코어와 동시에 상호 작용할 수 있도록 합니다.
구성 관리를 위해 Hydra와 통합되며, 다양한 JAX 기반 MARL 환경 제품군에 대한 래퍼를 제공합니다.
대상
복잡한 모듈식 라이브러리의 오버헤드 없이 대규모로 MARL 알고리즘을 구현, 테스트 및 수정하려는 강화 학습 분야의 연구원 및 실무자.
하이라이트
- 다양한 알고리즘 지원: PPO, Q-Learning, SAC, MAT 및 Sable의 구현을 포함하며, 독립 학습자 및 분산 실행을 통한 중앙 집중식 훈련(CTDE)과 같은 다양한 학습 패러다임을 지원합니다.
- JAX 기반 속도: JAX가 아닌 라이브러리와 비교하여
pmap및vmap을 활용하여 매우 빠른 실험을 구현합니다. - 통계적으로 강력한 평가: 플로팅 및 집계를 쉽게 하기 위해 표준 MARL-eval 지침에 따라 JSON 파일로 로깅하는 것을 기본적으로 지원합니다.
- 유연한 환경 지원: Multi-Robot Warehouse, StarCraft Multi-Agent Challenge 및 Multi-Agent Brax와 같은 환경에 대한 즉시 사용 가능한 지원을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트