instadeepai/Mava
🦁 A research-friendly codebase for fast experimentation of multi-agent reinforcement learning in JAX
解決する課題
Mava は、マルチエージェント強化学習 (MARL) を迅速に実験する必要がある研究者向けに設計されています。GPU や TPU などのハードウェアアクセラレータ全体にスケールできる高性能で分散型の MARL アルゴリズム実装のニーズを満たしつつ、迅速な反復と変更が可能なほどシンプルさを保っています。
仕組み
JAX の上に構築された Mava は、単一ファイルの実装を使用してコードを明確でアクセスしやすく保ちます。スケーリングのために2つの主要な分散アーキテクチャをサポートしています:
- Anakin: JAX で記述された環境向けに使用され、最大速度を実現するためにトレーニングループ全体のエンドツーエンドの JIT コンパイルを可能にします。
- Sebulba: JAX で記述されていない環境向けに使用され、ハードウェアアクセラレータが複数の CPU コアと同時に相互作用することを可能にします。
設定管理のために Hydra と統合されており、さまざまな JAX ベースの MARL 環境スイート用のラッパーを提供します。
対象者
複雑なモジュラーライブラリのオーバーヘッドなしに、大規模な MARL アルゴリズムを実装、テスト、変更したい強化学習分野の研究者および実践者。
ハイライト
- 多様なアルゴリズムサポート: PPO、Q-Learning、SAC、MAT、Sable の実装を含み、独立学習器や分散実行を伴う集中トレーニング (CTDE) などのさまざまな学習パラダイムをサポートします。
- JAX による高速化: JAX 以外のライブラリと比較して、
pmapとvmapを活用して極めて高速な実験を実現します。 - 統計的に堅牢な評価: プロットと集計を容易にするための標準的な MARL-eval ガイドラインに従って JSON ファイルへのログ記録をネイティブにサポートします。
- 柔軟な環境サポート: Multi-Robot Warehouse、StarCraft Multi-Agent Challenge、Multi-Agent Brax などの環境をすぐにサポートします。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト