cvg/vidmap

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion (ECCV 2026)

解決的問題

VidMap 是一個專為影片設計的離線 Structure-from-Motion (SfM) 系統。它透過利用影片數據中固有的時間結構,解決了從影片序列中估計相機姿態、相機內參並建立稀疏 3D 地圖的挑戰。

工作原理

VidMap 使用由影片感知前端和溯源感知全域建圖階段組成的兩個階段流水線。它結合了幾個關鍵組件:

  • Temporal Tracks: 跨幀追蹤特徵以保持一致性。
  • Loop Closures: 識別相機何時回到先前訪問過的位置以修正漂移。
  • Metric Depth: 結合深度預測以提供尺度與幾何結構。
  • Global Optimization: 擴展 COLMAP 全域建圖流水線以優化相機姿態與 3D 點。

適用對象

此工具適用於電腦視覺、3D 重建與機器人領域的研究人員與開發人員,特別是那些需要將影片素材轉換為準確 3D 地圖與相機軌跡的人員。

亮點

  • COLMAP Integration: 擴展了現有的 COLMAN 全域建圖流水線,以改進基於影片的 SfM。
  • GPU 加速: 透過 Ceres 2.3+ 支援 CUDA 與 cuDSS,實現更快的全域定位與光束法平差。
  • 全面的視覺化: 包括基於瀏覽器的檢視器與基於 Rerun 的回放功能,用於查看求解器狀態與飛行路徑。
  • 基準測試支援: 內建工具,用於在 LaMAR、EuRoC、ETH3D-SLAM 與 CroCoDL 等數據集上準備與評估結果。
  • 靈活的配置: 使用 Hydra 與 OmegaConf 對前端與建圖超參數進行詳細控制。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案