cvg/vidmap

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion (ECCV 2026)

해결하는 문제

VidMap은 비디오를 위해 특별히 설계된 오프라인 Structure-from-Motion (SfM) 시스템입니다. 비디오 데이터에 내재된 시간적 구조를 활용하여 비디오 시퀀스로부터 카메라 포즈, 카메라 내부 파라미터를 추정하고 희소한 3D 지도를 생성하는 과제를 해결합니다.

작동 방식

VidMap은 비디오 인식 프론트엔드와 출처 인식 글로벌 매핑 단계로 구성된 2단계 파이프라인을 사용합니다. 다음과 같은 핵심 구성 요소를 결합합니다:

  • Temporal Tracks: 프레임 간의 특징을 추적하여 일관성을 유지합니다.
  • Loop Closures: 카메라가 이전에 방문한 위치로 돌아올 때를 식별하여 드리프트를 보정합니다.
  • Metric Depth: 깊이 예측을 통합하여 스케일과 기하학적 구조를 제공합니다.
  • Global Optimization: COLMAP 글로벌 매핑 파이프라인을 확장하여 카메라 포즈와 3D 포인트를 최적화합니다.

대상 사용자

이 도구는 컴퓨터 비전, 3D 재구성 및 로봇 공학 분야에서 연구하는 연구자와 개발자, 특히 비디오 영상을 정확한 3D 지도와 카메라 궤적으로 변환해야 하는 분들을 위한 것입니다.

주요 특징

  • COLMAP Integration: 기존 COLMAP 글로벌 매핑 파이프라인을 확장하여 향상된 비디오 기반 SfM을 제공합니다.
  • GPU Acceleration: Ceres 2.3+를 통해 CUDA 및 cuDSS를 지원하여 더 빠른 글로벌 포지셔닝 및 번들 조정을 지원합니다.
  • Comprehensive Visualization: 솔버 상태 및 플라이스루(flythrough)를 위한 브라우저 기반 뷰어와 Rerun 기반 재생 기능을 포함합니다.
  • Benchmark Support: LaMAR, EuRoC, ETH3D-SLAM, CroCoDL과 같은 데이터셋에서 결과를 준비하고 평가할 수 있는 내장 도구를 제공합니다。
  • Flexible Configuration: Hydra와 OmegaConf를 사용하여 프론트엔드 및 매핑 하이퍼파라미터를 세밀하게 제어할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트