zju3dv/street_crafter

[CVPR 2025] StreetCrafter: Street View Synthesis with Controllable Video Diffusion Models

解决的问题

StreetCrafter 解决了从新轨迹合成逼真街景视频的挑战。它能够生成高质量、可控制的街景,同时在不同视角间保持一致性,这在使用标准视频生成工具时通常难以实现。

工作原理

该系统采用三步流程:

  1. 条件生成:处理 LiDAR 数据、校准图像和物体轨迹,生成彩色点云,作为模型的像素级条件。
  2. 可控生成:使用观测图像和参考嵌入对视频扩散模型进行优化,以 LiDAR 渲染为条件,生成可控的街景视频。
  3. 3D 蒸馏:将扩散模型生成的视图作为监督信号,用于优化动态 3D 高斯点阵(3DGS)表示,从而实现新轨迹的渲染。

适用人群

本项目专为从事计算机视觉、自动驾驶仿真和 3D 场景重建的研究人员和开发者设计。

主要亮点

  • LiDAR 引导:使用彩色点云为视频生成提供精确的空间条件。
  • 混合方法:结合视频扩散模型的生成能力与 3D 高斯点阵的结构一致性。
  • 新视角合成:能够从完全新的轨迹渲染街景。
  • 动态表示:支持将扩散生成的内容蒸馏为动态 3D 表示。

相关

  • 项目
  • 项目
  • 项目
  • 项目