instadeepai/jumanji

🕹️ A diverse suite of scalable reinforcement learning environments in JAX

What it solves

Jumanjiは、RLの研究開発を加速させるために設計された、スケーラブルな強化学習 (RL) 環境スイートを提供します。高速かつハードウェア加速された環境により、反復作業の高速化と大規模な実験が可能になり、複雑さを軽減します。

How it works

完全にJAXで記述されており、JAXの自動ベクトル化、並列化 (jax.vmap, jax.pmap)、およびJITコンパイル (jax.jit) の機能を活用しています。OpenAI Gymにインスパイアされたインターフェース(レジストリとrenderメソッドを使用)と、DeepMind Environmentのインターフェース(TimeStep 構造を使用)を組み合わせています。

Who it’s for

エージェントのテストに高性能な環境が必要なRL実務家および研究者、特に組合せ問題、論理ゲーム、ルーティング問題に焦点を当てている方向けに設計されています。

Highlights

  • Diverse Environment Suite: 論理 (例: Sudoku, Rubik's Cube)、パッキング (例: BinPack, Tetris)、ルーティング (例: TSP, CVRP)、およびスウォーム (例: Search and Rescue) のカテゴリにわたる22個の環境を含みます。
  • Hardware Acceleration: 完全にJAXベースであり、GPU/TPU上で大規模な並列化と高速実行が可能です。
  • Framework Agnostic: Acme, Stable Baselines3, RLlib, および Gymnasium などの一般的なRLライブラリ用のラッパーを提供します。
  • Scalable Difficulty: 環境は、その難易度を任意に高く設定できるように設計されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト