Genie 3 实时世界模型发布
TL;DR
Genie 3 是 DeepMind 最新的通用世界模型,能够实时生成细节丰富、交互式的 3D 环境(24 fps,720p),并在数分钟内保持视觉一致性,为具身 AI 研究和生成媒体打开了新可能。
Genie 3 是什么?
Genie 3 是一个基础世界模型,基于 DeepMind 早期的 Genie 1 和 Genie 2 系统进行扩展。它可以根据自然语言提示创建交互式世界,用户能够以 24 帧每秒的速度在 720p 分辨率下进行导航。与之前的模型不同,Genie 3 支持实时控制、更长时程的一致性以及更广泛的物理和视觉现象。
技术进展
实时帧生成
- 模型自回归地生成每一帧,并以完整的过去轨迹为条件,实现响应式导航。
- 计算每秒多次执行,以融合新的用户输入,实现流畅的 24 fps 播放。
长时程环境一致性
- Genie 3 能保留最长约一分钟的视觉记忆,防止自回归视频生成中常见的漂移。
- 一致性在以下示例中得到展示:房屋粉刷任务、带有传送门的维多利亚街道,以及对古雅典的多分钟探索,其中静态元素(如树木)保持稳定。
物理属性建模
- 模型模拟水、光照、熔岩流、风等自然现象,具备真实的动力学。
- 示例提示展示了火山地形导航、受飓风影响的人行道以及深海水母的运动。
多样化内容生成
- 自然生态系统 – 森林、冰湖和海洋环境,拥有可信的动植物。
- 虚构动画 – 风格化生物、超现实景观以及戏剧性的世界扭曲事件。
- 历史与地理场景 – 看起来逼真的阿尔卑斯山、威尼斯运河、克诺索斯宫以及伊利诺伊州的现代街道重建。
展示的能力
| 能力 | 示例提示 | 观察 |
|---|---|---|
| 物理模拟 | Volcanic terrain with lava pools | 真实的粒子效果和地形交互。 |
| 生态系统生成 | Glacial lake run with wildlife | 连贯的动物行为和植被。 |
| 虚构动画 | Fluffy creature on rainbow bridge | 风格化的高细节角色动画。 |
| 历史重建 | Palace of Knossos in its heyday | 合理的建筑细节。 |
| 可提示的世界事件 | Change weather or add objects via text | 在不重新渲染的情况下即时改变世界。 |
具身代理研究
Genie 3 作为测试平台,用于训练诸如 DeepMind 的 SIMA 2 等代理。代理向模型发出导航指令,模型随后渲染相应的世界状态。由于 Genie 3 能在更长的动作序列中保持一致性,代理能够追求更复杂的多步骤目标,使我们更接近在开放式课程中训练代理的目标。
限制
- 动作空间 – 直接的代理动作受限;许多世界变化仍需通过文本提示而非具身交互实现。
- 多代理动态 – 模拟多个独立代理之间的交互仍是未解决的挑战。
- 地理真实性 – 真实世界地点为近似,缺乏精确的地理准确性。
- 文本渲染 – 生成的文本通常只有在提示中明确包含时才可读。
- 交互时长 – 连续交互目前仅限几分钟,而非数小时。
负责任的部署
DeepMind 正在将 Genie 3 作为有限的研究预览发布给少量学术界和创作者。此分阶段推出旨在收集关于安全性、滥用潜力和社会影响的反馈,同时负责开发与创新团队致力于风险缓解策略。
未来方向
- 扩大对更广泛测试者群体的访问,最终面向公众。
- 延长交互时长和动作空间,以支持更丰富的具身任务。
- 提升地理准确性和多代理模拟。
- 探索机器人和自主系统的教育、培训和评估应用。
引用
如果您引用 Genie 3,请使用以下提供的 BibTeX 条目:
@article{genie32025,
title={Genie 3: A new frontier for world models},
author={Ball, Phil and Bauer, Jakob and ... and Zubov, Vadim},
journal={DeepMind Blog},
year={2025},
url={https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/}
}