cvg/vidmap

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion (ECCV 2026)

解决的问题

VidMap 是一个专门为视频设计的离线 Structure-from-Motion (SfM) 系统。它通过利用视频数据中固有的时间结构,解决了从视频序列中估计相机姿态、相机内参并创建稀疏 3D 地图的挑战。

工作原理

VidMap 使用由视频感知前端和溯源感知全局制图阶段组成的两个阶段流水线。它结合了几个关键组件:

  • Temporal Tracks: 跨帧跟踪特征以保持一致性。
  • Loop Closures: 识别相机何时回到之前访问过的位置以修正漂移。
  • Metric Depth: 结合深度预测以提供尺度和几何结构。
  • Global Optimization: 扩展 COLMAP 全局制图流水线以优化相机姿态和 3D 点。

适用对象

该工具适用于计算机视觉、3D 重建和机器人领域的科研人员和开发人员,特别是那些需要将视频素材转换为准确的 3D 地图和相机轨迹的人员。

亮点

  • COLMAP Integration: 扩展了现有的 COLMAP 全局制图流水线,以改进基于视频的 SfM。
  • GPU 加速: 通过 Ceres 2.3+ 支持 CUDA 和 cuDSS,实现更快的全局定位和光束法平差。
  • 全面的可视化: 包括基于浏览器的查看器和基于 Rerun 的回放功能,用于查看求解器状态和飞行路径。
  • 基准测试支持: 内置工具,用于在 LaMAR、EuRoC、ETH3D-SLAM 和 CroCoDL 等数据集上准备和评估结果。
  • 灵活的配置: 使用 Hydra 和 OmegaConf 对前端和制图超参数进行详细控制。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目