nv-tlabs/Gamma-World

Implementation of Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

解决的问题

Gamma-World 解决了现有交互式视频世界模型主要局限于单智能体场景的局限性。它能够在多个独立可控智能体(如玩家或机器人)同时在共享空间内交互的环境中,生成时间与视角上保持一致的连贯未来帧。

工作原理

该系统使用因果多智能体扩散变换器(DiT),以多个智能体的同步观测和动作作为输入。其包含三项关键技术革新:

  1. 单纯形旋转智能体编码:3D RoPE 的无参数扩展,将智能体表示为旋转角度空间中正则单纯形的顶点,使智能体在排列上等价,同时保持各自身份的独立性。
  2. 稀疏枢纽注意力:不采用密集的全对全注意力机制,而是使用可学习的枢纽令牌来中介智能体之间的通信,将计算成本从与智能体数量的平方关系降低到线性关系。
  3. 知识蒸馏:将完整的上下文扩散教师模型蒸馏为因果学生模型,利用 KV 缓存逐块生成时间序列,实现实时流式传输。

适用对象

本项目专为从事多智能体模拟、交互式视频生成和现实世界多机器人协调的研究人员与开发者设计。

主要亮点

  • 实时性能:支持 24 FPS 的动作响应式生成。
  • 零样本泛化:无需额外训练即可从 2 人扩展到 4 人。
  • 可扩展架构:稀疏枢纽注意力确保随着智能体数量增加仍保持高效。
  • 多功能应用:适用于虚拟游戏和现实世界机器人协调等多种场景。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目