Project Genie:Google DeepMind 的交互式世界模型原型

通过 Genie 3 实时世界模拟

Project Genie 由 Genie 3 世界模型提供动力,该模型模拟环境的动态并预测行为如何影响环境的状态。与静态的 3D 快照不同,Genie 3 会在用户移动并与世界交互时实时生成前方路径。

此能力可用于模拟多种场景,包括:

  • 机器人仿真
  • 动画与虚构建模
  • 探索历史场景和特定地点

Project Genie 的核心功能

Project Genie 是一个网页应用,整合了 Genie 3、Nano Banana Pro 和 Gemini,提供三项主要用户功能:

1. 世界草图绘制

用户可以通过文本、生成的图像或上传的图像进行提示,创建活生生、不断扩展的环境。此功能允许用户定义角色和探索方式(例如步行、骑乘、飞行或驾驶)。

与 Nano Banana Pro 的集成实现了“世界草图绘制”,用户可以预览并修改图像,以微调世界外观,并在进入环境前选择角色视角(第一人称或第三人称)。

2. 世界探索

Project Genie 根据用户的操作实时生成可导航的环境。用户可以在世界中穿行,并在移动于生成空间时调整摄像机视角。

3. 世界混搭

用户可以在已有提示的基础上重新混搭世界,形成新的诠释。平台提供精选世界画廊和随机图标以供灵感。用户还可以下载其探索和创建的世界视频。

当前局限性与负责任的开发

作为早期研究原型,Project Genie 及其底层的 Genie 3 模型存在若干已知局限性:

  • 视觉和物理逼真度:生成的世界可能并不总是逼真,或严格遵循提示、图像或现实物理规律。
  • 控制与延迟:角色有时可能表现出较低的可控性或对用户输入的响应延迟较高。
  • 时长:生成目前限制为 60 秒。
  • 功能缺口:某些在八月宣布的功能,例如在探索过程中可通过提示触发的事件,尚未在原型中实现。

Google DeepMind 表示,此次发布的目标是更好地了解世界模型在 AI 研究和生成媒体中的应用方式。

Sources