microsoft/LatentSpatialMemory

Latent Spatial Memory for Video World Models

解决的问题

本项目解决了依赖显式 3D 缓存的视频世界模型效率低下和不一致的问题。传统方法通常需要对场景内容进行重复的 RGB 渲染和重新编码,这在计算上非常昂贵且极其耗费内存。

工作原理

Latent Spatial Memory 将持久化的 3D 场景内容直接存储为潜在表示,而不是 RGB 图像。它从初始观察中构建持久化的潜在缓存,并且对于每个生成的视频块,读取目标视角的记忆,在去噪过程中使用它,然后将更新后的静态场景内容写回缓存。

适用人群

从事视频世界模型、3D 场景生成以及视频合成中高效空间一致性工作的研究人员和开发者。

亮点

  • 潜在记忆:直接在潜在空间中维护持久化的 3D 场景上下文。
  • 无 RGB 绕道:消除了重复渲染和重新编码周期的需求。
  • 记忆生命周期:在生成的视频块之间实现了初始化、读取、去噪和更新的完整周期。
  • 效率:实现了显著更快的生成速度(10.57倍)和大幅降低的 3D 缓存内存使用量(降低 55 倍)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目