nv-tlabs/Gamma-World
Implementation of Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
解决的问题
Gamma-World 解决了现有交互式视频世界模型主要局限于单智能体场景的局限性。它能够在多个独立可控智能体(如玩家或机器人)同时在共享空间内交互的环境中,生成时间与视角上保持一致的连贯未来帧。
工作原理
该系统使用因果多智能体扩散变换器(DiT),以多个智能体的同步观测和动作作为输入。其包含三项关键技术革新:
- 单纯形旋转智能体编码:3D RoPE 的无参数扩展,将智能体表示为旋转角度空间中正则单纯形的顶点,使智能体在排列上等价,同时保持各自身份的独立性。
- 稀疏枢纽注意力:不采用密集的全对全注意力机制,而是使用可学习的枢纽令牌来中介智能体之间的通信,将计算成本从与智能体数量的平方关系降低到线性关系。
- 知识蒸馏:将完整的上下文扩散教师模型蒸馏为因果学生模型,利用 KV 缓存逐块生成时间序列,实现实时流式传输。
适用对象
本项目专为从事多智能体模拟、交互式视频生成和现实世界多机器人协调的研究人员与开发者设计。
主要亮点
- 实时性能:支持 24 FPS 的动作响应式生成。
- 零样本泛化:无需额外训练即可从 2 人扩展到 4 人。
- 可扩展架构:稀疏枢纽注意力确保随着智能体数量增加仍保持高效。
- 多功能应用:适用于虚拟游戏和现实世界机器人协调等多种场景。
相关
- 项目
- 项目
- 项目
- 项目
- 项目