Genie 3 实时世界模型发布

TL;DR

Genie 3 是 DeepMind 最新的通用世界模型,能够实时生成细节丰富、交互式的 3D 环境(24 fps,720p),并在数分钟内保持视觉一致性,为具身 AI 研究和生成媒体打开了新可能。

Genie 3 是什么?

Genie 3 是一个基础世界模型,基于 DeepMind 早期的 Genie 1 和 Genie 2 系统进行扩展。它可以根据自然语言提示创建交互式世界,用户能够以 24 帧每秒的速度在 720p 分辨率下进行导航。与之前的模型不同,Genie 3 支持实时控制、更长时程的一致性以及更广泛的物理和视觉现象。

技术进展

实时帧生成

  • 模型自回归地生成每一帧,并以完整的过去轨迹为条件,实现响应式导航。
  • 计算每秒多次执行,以融合新的用户输入,实现流畅的 24 fps 播放。

长时程环境一致性

  • Genie 3 能保留最长约一分钟的视觉记忆,防止自回归视频生成中常见的漂移。
  • 一致性在以下示例中得到展示:房屋粉刷任务、带有传送门的维多利亚街道,以及对古雅典的多分钟探索,其中静态元素(如树木)保持稳定。

物理属性建模

  • 模型模拟水、光照、熔岩流、风等自然现象,具备真实的动力学。
  • 示例提示展示了火山地形导航、受飓风影响的人行道以及深海水母的运动。

多样化内容生成

  • 自然生态系统 – 森林、冰湖和海洋环境,拥有可信的动植物。
  • 虚构动画 – 风格化生物、超现实景观以及戏剧性的世界扭曲事件。
  • 历史与地理场景 – 看起来逼真的阿尔卑斯山、威尼斯运河、克诺索斯宫以及伊利诺伊州的现代街道重建。

展示的能力

能力 示例提示 观察
物理模拟 Volcanic terrain with lava pools 真实的粒子效果和地形交互。
生态系统生成 Glacial lake run with wildlife 连贯的动物行为和植被。
虚构动画 Fluffy creature on rainbow bridge 风格化的高细节角色动画。
历史重建 Palace of Knossos in its heyday 合理的建筑细节。
可提示的世界事件 Change weather or add objects via text 在不重新渲染的情况下即时改变世界。

具身代理研究

Genie 3 作为测试平台,用于训练诸如 DeepMind 的 SIMA 2 等代理。代理向模型发出导航指令,模型随后渲染相应的世界状态。由于 Genie 3 能在更长的动作序列中保持一致性,代理能够追求更复杂的多步骤目标,使我们更接近在开放式课程中训练代理的目标。

限制

  • 动作空间 – 直接的代理动作受限;许多世界变化仍需通过文本提示而非具身交互实现。
  • 多代理动态 – 模拟多个独立代理之间的交互仍是未解决的挑战。
  • 地理真实性 – 真实世界地点为近似,缺乏精确的地理准确性。
  • 文本渲染 – 生成的文本通常只有在提示中明确包含时才可读。
  • 交互时长 – 连续交互目前仅限几分钟,而非数小时。

负责任的部署

DeepMind 正在将 Genie 3 作为有限的研究预览发布给少量学术界和创作者。此分阶段推出旨在收集关于安全性、滥用潜力和社会影响的反馈,同时负责开发与创新团队致力于风险缓解策略。

未来方向

  • 扩大对更广泛测试者群体的访问,最终面向公众。
  • 延长交互时长和动作空间,以支持更丰富的具身任务。
  • 提升地理准确性和多代理模拟。
  • 探索机器人和自主系统的教育、培训和评估应用。

引用

如果您引用 Genie 3,请使用以下提供的 BibTeX 条目:

@article{genie32025,
  title={Genie 3: A new frontier for world models},
  author={Ball, Phil and Bauer, Jakob and ... and Zubov, Vadim},
  journal={DeepMind Blog},
  year={2025},
  url={https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/}
}

Sources