nv-tlabs/Gamma-World
Implementation of Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
解決的問題
Gamma-World 解決了現有互動式影片世界模型主要侷限於單一智能體情境的問題。它能於多個獨立可控智能體(如玩家或機器人)同時於共享空間內互動的環境中,生成時間與觀點上保持一致的連貫未來畫格。
工作原理
該系統使用因果式多智能體擴散轉換器(DiT),以多個智能體的同步觀測與動作作為輸入。其包含三項關鍵技術革新:
- 單純形旋轉智能體編碼:3D RoPE 的無參數擴展,將智能體表示為旋轉角度空間中正則單純形的頂點,使智能體在排列上等價,同時保持各自身分的獨立性。
- 稀疏樞紐注意力:不採用密集的全對全注意力機制,而是使用可學習的樞紐權杖來中介智能體之間的通訊,將計算成本從與智能體數量的平方關係降低至線性關係。
- 知識蒸餾:將完整的上下文擴散教師模型蒸餾為因果式學生模型,利用 KV 快取逐塊生成時間序列,實現即時串流。
適用對象
本專案專為從事多智能體模擬、互動式影片生成與現實世界多機器人協調的研究人員與開發者設計。
主要亮點
- 即時性能:支援 24 FPS 的動作回應式生成。
- 零樣本泛化:無需額外訓練即可從 2 人擴展至 4 人。
- 可擴展架構:稀疏樞紐注意力確保隨著智能體數量增加仍保持高效。
- 多功能應用:適用於虛擬遊戲與現實世界機器人協調等多種場景。
相關
- 專案
- 專案
- 專案
- 專案
- 專案