lukasHoel/video_to_world

Our method reconstructs 3D worlds from video diffusion models using non-rigid alignment to resolve inherent 3D inconsistencies in the generated sequences.

解决的问题

本项目解决了由视频扩散模型生成的视频中存在的3D不一致性问题。尽管这些模型能够生成视觉上令人印象深刻的序列,但通常缺乏几何一致性,使得从中重建稳定的3D世界变得困难。该工具通过非刚性对齐来解决这些不一致性,从而创建出连贯的3D重建结果。

工作原理

该系统遵循多阶段流程,将视频转换为3D场景:

  1. 预处理:使用 DepthAnything-3 从输入视频中估计每帧的点云。
  2. 非刚性对齐:采用迭代的 Frame-to-model ICP(迭代最近点)过程,将这些不一致的每帧点云对齐到一个单一的基准帧,生成形变场。
  3. 全局优化:联合优化所有帧的形变,以增强最终基准点云的清晰度。
  4. 逆形变训练:训练一个网络,将基准空间中的点映射回每帧的相机空间。
  5. 高斯点绘:基于基准点云优化2D或3D高斯点绘(GS)场景,并使用逆形变网络在训练过程中处理每帧特有的形变。

适用人群

从事AI生成视频、3D重建和计算机视觉的研究人员与开发者,希望将不一致的视频扩散输出转化为稳定3D环境的人群。

主要亮点

  • 处理不一致性:专门设计用于修复视频扩散模型固有的几何“漂移”和不一致性问题。
  • 灵活渲染:支持最终场景表示的2D和3D高斯点绘。
  • 端到端流程:提供从原始MP4输入到最终3D PLY导出或交互式可视化的一整套工作流。
  • 集成性:利用最先进的工具,如 DepthAnything-3 进行深度估计,以及 gsplat 进行渲染。

相关

  • 项目
  • 项目
  • 项目
  • 项目