Atlas: 空间智能的世界模型

World Labs 推出了 Atlas,这是一种旨在实现“空间智能”的新一代世界模型。Atlas 是一个多模态自回归扩散 Transformer,从零开始预训练,能够原生处理文本、图像、视频和 3D 数据。通过将这些输入组合到一个共享的空间上下文中,Atlas 可以生成一致的 3D 环境,从稀疏图像中重建真实世界场景,并为机器人技术和 VFX(视觉特效)模拟复杂的时空动态。

原生空间控制与相机驱动生成

Atlas 通过使用精确的相机几何结构作为原生输入类型,而不是依赖粗略的文本描述,实现了像素级的相机控制。这允许用户指定精确的相机位置和角度,以生成场景的新视图。

  • 单图外推 (Single-Image Extrapolation):仅凭一张输入图像,Atlas 就可以想象出场景的其余部分,在保持几何一致性的同时,从任何角度生成视图。
  • 空间上下文管理:Atlas 将输入编码到 3D 基础的空间上下文中。用户可以在 3D 空间中放置不相关的参考图像,模型将生成一个在它们之间平滑插值的世界,想象出诸如走廊或门口之类的过渡区域。
  • 长视频生成:通过将手工设计的相机路径与空间上下文相结合,Atlas 可以生成分辨率为 1440p、长度长达一分钟的连贯视频。

高保真空间重建

Atlas 解决了从稀疏输入进行新视角合成这一基础计算机视觉问题。它仅需两三张图像即可重建真实世界空间,其表现通常优于专门的 3D 重建模型。

  • 稀疏到稠密重建 (Sparse-to-Dense Reconstruction):模型可以利用其预训练的世界知识来填补场景中数据缺失的部分。随着输入图像的增加,模型会从想象合理的填充内容转向提供忠实、精确的重建。
  • 显式 3D 输出:除了 2D 帧,Atlas 还能原生生成 3D 深度图。这允许模型以点云或 3D Gaussian splats 的形式输出世界,使重建的环境可用于游戏、设计和 VFX 工作流。

用于机器人技术和 VFX 的时空模拟

Atlas 作为一个世界模拟器,对环境如何随时间演变进行建模。这种能力对于机器人技术中的“Real-to-Sim”工作流特别有用。

  • 机器人模拟:Atlas 可以从手机视频中重建一个空间,然后生成机器人传感器在导航该空间时会观察到的 RGB 和深度数据。这有助于在不需要昂贵 LiDAR 或专门采集设备的情况下,为机器人导航和操作提供多样化的训练数据。
  • 视频重构 (Video Reframing):Atlas 可以将几段普通的相机视图转换为“子弹时间”效果,允许用户利用仅有的三部手机拍摄的素材,冻结时间并从不可能的角度重新构图。

技术架构:多模态自回归扩散 Transformer

Atlas 偏离了标准的 LLM 或视频模型架构,以优先考虑空间控制。其架构由四个关键属性定义:

  1. 多模态 (Multimodal):它原生处理文本、图像、相机位姿 (camera poses) 和 3D 深度图。
  2. 自回归 (Autoregressive):它逐个生成序列元素,使其能够通过将各种任务视为不同的序列类型来适应各种任务。
  3. 扩散 (Diffusion):作为一个修正流 (rectified flow) 模型,它通过逐渐去噪来生成输出,从而在推理速度和质量之间实现权衡。
  4. Transformer:它使用 Transformer 主干网络以确保可扩展性并与现代硬件加速(例如 KV-caching)兼容。

性能与扩展性

World Labs 报告称,Atlas 性能优于专门的模型,在相机约束生成和 3D 重建方面均表现出色。在相机控制生成的真人评估试验中,Atlas 相比于近期的视频模型表现出了显著优势,尤其是在相机轨迹变得更加复杂时。在 3D 重建基准测试中,Atlas 的误差率低于目前最好的专门开源重建模型。

World Labs 表示,随着训练计算量的增加,模型的性能会持续提升,表明扩展 (scaling) 将继续驱动能力提升。

社区洞察与反方观点

技术用户之间的讨论突出了当前世界模型方法的潜力与局限性:

"What does have obvious value is the latent knowledge that the model could have used to generate those synthetic views... the fact that Atlas is capable of identifying regions of the input images that look like 'floors'... suggests that it has a concept of 'floor-like walkability' which it could have learned."

其他用户也指出了在动态场景中可能存在的时空一致性和幻觉问题,特别是:

"I can see things appearing and disappearing (aka inconsistent hallucinations). See the dominos falling scene, it is easy to see dominos appearing and disappearing into thin air."

此外,一些开发者也表达了对结构化场景原语 (scene primitives) 的需求,而非仅仅是网格 (meshes) 或 splats,并指出对于 CAD 应用,用户需要的是可以进行尺寸标注的参数化表面,而不仅仅是视觉重建。

Sources

相关

  • Dispatch
  • 项目
  • 项目
  • Dispatch
  • Dispatch