instadeepai/jumanji

🕹️ A diverse suite of scalable reinforcement learning environments in JAX

What it solves

Jumanji는 RL 연구 및 개발을 가속화하기 위해 설계된 확장 가능한 강화 학습 (RL) 환경 제품군을 제공합니다. 복잡성을 줄이면서 더 빠른 반복과 대규모 실험을 가능하게 하는 고속, 하드웨어 가속 환경에 대한 필요성을 해결합니다.

Who it’s for

Jumanji는 RL 실무자 및 연구자를 위해 설계되었습니다. 특히 에이전트 테스트를 위한 고성능 환경이 필요하며, 조합론적 문제, 논리 게임, 경로 계획 문제를 다루는 연구자들에게 적합합니다.

How it works

전체적으로 JAX로 작성되어, JAX의 자동 벡터화, 병렬화 (jax.vmap, jax.pmap), 그리고 JIT 컴파일 (jax.jit) 기능을 활용합니다. OpenAI Gym에서 영감을 받은 인터페이스(레지스트리 및 render 메서드 사용)와 DeepMind Environment( TimeStep 구조 사용)를 결합합니

Highlights

  • Diverse Environment Suite: 논리 (예: Sudoku, Rubik's Cube), 패킹 (예: BinPack, Tetris), 라우팅 (예: TSP, CVRP), 그리고 스웜 (예: Search and Rescue) 카테고리의 22개 환경을 포함합니다.
  • Hardware Acceleration: 완전히 JAX 기반으로, GPU/TPU에서 대규모 병렬화와 고속 실행을 가능합니다.
  • Framework Agnostic: Acme, Stable Baselines3, RLlib, 및 Gymnasium과 같은 인기 있는 RL 라이브러리를 위한 래퍼를 제공합니다.
  • Scalable Difficulty: 환경의 난이도를 임의로 높게 확장할 수 있도록 설계되었습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트