nv-tlabs/Gamma-World

Implementation of Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

何を解決するか

Gamma-Worldは、既存のインタラクティブビデオワールドモデルが主に単一エージェント環境に焦点を当てているという制限に対処します。複数の独立して制御可能なエージェント(プレイヤーまたはロボットなど)が共有空間内で同時に相互作用する環境において、一貫性のある将来のフレームを生成可能で、時間的・視点的な整合性を保証します。

動作方法

このシステムは、複数エージェントからの同期観測と行動を入力として使用する因果的マルチエージェントDiffusion Transformer(DiT)を採用しています。以下の3つの技術的革新を実現しています:

  1. Simplex Rotary Agent Encoding:3D RoPEのパラメータフリーな拡張で、エージェントを回転角度空間内の正則単体の頂点として表現。エージェントの順序に依存せず、同時に個別性を維持。
  2. Sparse Hub Attention:すべてのエージェント間の密な全対全アテンションではなく、学習可能なハブトークンを介してエージェント間の通信を調整。エージェント数に対して計算コストを二次から線形に削減。
  3. Knowledge Distillation:完全な文脈を持つDiffusion教師モデルを、KVキャッシュを用いて時系列ブロックを逐次生成する因果的生徒モデルに蒸留。リアルタイムストリーミングを可能に。

対象ユーザー

本プロジェクトは、マルチエージェントシミュレーション、インタラクティブビデオ生成、現実世界のマルチロボット協調に関する研究者および開発者向けに設計されています。

主な特徴

  • リアルタイム性能:24 FPSで行動に応じた生成が可能。
  • ゼロショット一般化:訓練を追加せずに2人から4人までのプレイヤーにスケーリング可能。
  • スケーラブルなアーキテクチャ:Sparse Hub Attentionにより、エージェント数の増加に対しても効率性を維持。
  • 多様な応用:仮想ゲームと現実世界のロボット協調の両方に適用可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト