instadeepai/jumanji

🕹️ A diverse suite of scalable reinforcement learning environments in JAX

What it solves

Jumanji 提供了一套可擴展的強化學習 (RL) 環境套件,旨在加速 RL 研究與開發。它解決了對高速、硬體加速環境的需求,這些環境允許更快的迭代與大規模實驗,同時降低複雜度。

How it works

該函式庫完全使用 JAX 編寫,利用了 JAX 的自動向量化、並行化 (jax.vmap, jax.pmap) 以及 JIT 編譯 (jax.jit) 能力。它結合了受 OpenAI Gym 啟發的介面(使用註冊機制與渲染方法)以及 DeepMind Environment 的介面(使用 TimeStep 結構)。

Who it’s for

它專為需要高性能環境來測試代理程式的 RL 從業者與研究人員設計,特別是那些專注於組合問題、邏輯遊戲與路徑規劃問題的研究者。

Highlights

  • Diverse Environment Suite: 包括跨越邏輯 (例如 Sudoku, Rubik's Cube)、裝箱 (例如 BinPack, Tetris)、路徑規劃 (例如 TSP, CVRP) 以及群集 (例如 Search and Rescue) 等類別的 22 個環境。
  • Hardware Acceleration: 完全基於 JAX,能夠在 GPU/TPU 上實現大規模並行化與高速執行。
  • Framework Agnostic: 為流行的 RL 函式庫提供封裝器,例如 Acme, Stable Baselines3, RLlib, 與 Gymnasium。
  • Scalable Difficulty: 環境設計旨在使其難度可以被擴展至任意困難的程度。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案