SANA-WM: 突破分钟级世界建模的边界
追求高保真、长篇视频生成长期以来一直受到两个主要障碍的困扰:计算成本和时间一致性。大多数现有模型在维持超过几秒钟的连贯世界状态方面表现挣扎,通常会陷入视觉“slop”(混乱)或丢失空间几何信息。
SANA-WM 是 NVIDIA 推出的一个新的开源世界模型,旨在解决这些问题。通过将精简的 2.6B 参数主干网络与混合注意力机制相结合,SANA-WM 可以根据单张图像和相机轨迹生成 720p、长达一分钟的视频,同时保持足够的效率,使其能够在单个 GPU 上运行。这代表了在使世界模型可用于研究以及在机器人技术和游戏领域的潜在部署方面迈出了重大飞跃。
SANA-WM 的架构
SANA-WM 能够在没有 Transformer 常见的内存爆炸问题的情况下生成长时程视频,这得益于四个核心架构创新:
1. 混合线性注意力机制 (Hybrid Linear Attention)
传统的 softmax attention 随序列长度呈二次方增长,使得生成分钟级视频在计算上变得极其昂贵。SANA-WM 利用了 Hybrid Linear Attention,它将逐帧的 Gated DeltaNet 与周期性的 softmax attention 相结合。这使得模型能够在保持紧凑内存使用的同时,维持一整分钟的连贯世界状态,从而避免了困扰所有 softmax 架构的“内存溢出”(OOM)错误。
2. 双分支相机控制
为了实现精确的 6-DoF(六自由度)相机轨迹,该模型采用了双分支系统:
- Coarse Global Pose Branch(粗粒度全局姿态分支): 处理相机的总体运动和方向。
- Fine Pixel-Aligned Geometric Branch(细粒度像素对齐几何分支): 确保对度量相机路径的高保真遵循,从而实现专业级的相机控制。
3. 两阶段生成流水线
视觉质量通过一个两阶段过程得到进一步提升。在 2.6B 主干网络生成初始的长序列 rollout 之后,会应用专门的 17B long-video refiner。这第二个阶段会锐化纹理、改善运动流畅度,并保持“后期窗口”(视频末尾)的质量,防止长 AI 生成序列中常见的退化现象。
4. 鲁棒的标注流水线
高质量数据是任何世界模型的基石。该团队开发了一套流水线,从公开视频中提取准确的度量尺度 6-DoF 相机姿态,为模型提供了高质量、时空一致的动作标签。这使得模型能够在 15 天内使用 64 台 H100 GPU,仅用约 ~213K 个公开视频片段进行训练。
效率与部署
SANA-WM 最引人注目的主张之一是其精简的计算配置。虽然训练需要 H100 集群,但推理过程是为单个 GPU 设计的。
根据技术数据,该模型的蒸馏版本可以在单个 RTX 5090 上使用 NVFP4 量化,仅用 34 秒 即可对 60 秒的 720p 片段进行去噪。这种吞吐量大约比具有同等视觉质量的先前开源基准模型高出 36 倍。
社区观点与评论
尽管取得了技术成就,SANA-WM 的发布在 Hacker News 的技术社区中引发了关于“世界模型”本质的细微辩论。
“意图性”差距
一些批评者认为,虽然视觉效果惊人,但这些模型缺乏人类设计环境中所具有的“意图性”。
“我从视频游戏的角度来看,这些世界模型让我感到困扰……在 FromSoftware 的游戏中,通常不会有一个物品被放错位置……我很难想象世界模型能够达到捕捉这种意图性的程度。”
这种批评表明,SANA-WM 创建了“阈限空间”(liminal spaces)——看起来很正确但缺乏让世界感觉生动且有目的性的底层逻辑、物理学或生态系统。
效用与机器人技术
虽然有些人质疑生成高保真视频的长期效用,但其他人则指出机器人技术是主要受益者。机器人系统通过构想一个模拟世界来“想象”动作的影响,这种能力可以极大地加速在安全、合成环境中的自主智能体训练。
“开源”辩论
正如许多现代 AI 发布一样,用户最初对“开源”标签表示怀疑,因为用户注意到权重(weights)最初被列为“即将推出”。然而,随后的社区发现表明,该模型可以通过 Hugging Face 获取用于研究用途,且权重具有商业可用的许可。
结论
SANA-WM 扩展了中小型参数模型所能实现的极限。通过优化注意力机制并实施两阶段细化过程,NVIDIA 已经证明,分钟级、高分辨率视频生成并不一定需要在推理时使用庞大的、闭源的工业级集群。无论这些模型最终会捕捉到设计世界的“灵魂”,还是仅仅作为高端视觉生成器,目前尚有待观察,但其效率提升是一个不可忽视的进步。