nv-tlabs/Gamma-World

Implementation of Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

解決的問題

Gamma-World 解決了現有互動式影片世界模型主要侷限於單一智能體情境的問題。它能於多個獨立可控智能體(如玩家或機器人)同時於共享空間內互動的環境中,生成時間與觀點上保持一致的連貫未來畫格。

工作原理

該系統使用因果式多智能體擴散轉換器(DiT),以多個智能體的同步觀測與動作作為輸入。其包含三項關鍵技術革新:

  1. 單純形旋轉智能體編碼:3D RoPE 的無參數擴展,將智能體表示為旋轉角度空間中正則單純形的頂點,使智能體在排列上等價,同時保持各自身分的獨立性。
  2. 稀疏樞紐注意力:不採用密集的全對全注意力機制,而是使用可學習的樞紐權杖來中介智能體之間的通訊,將計算成本從與智能體數量的平方關係降低至線性關係。
  3. 知識蒸餾:將完整的上下文擴散教師模型蒸餾為因果式學生模型,利用 KV 快取逐塊生成時間序列,實現即時串流。

適用對象

本專案專為從事多智能體模擬、互動式影片生成與現實世界多機器人協調的研究人員與開發者設計。

主要亮點

  • 即時性能:支援 24 FPS 的動作回應式生成。
  • 零樣本泛化:無需額外訓練即可從 2 人擴展至 4 人。
  • 可擴展架構:稀疏樞紐注意力確保隨著智能體數量增加仍保持高效。
  • 多功能應用:適用於虛擬遊戲與現實世界機器人協調等多種場景。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案