cvg/vidmap

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion (ECCV 2026)

解決する課題

VidMapは、ビデオに特化して設計されたオフラインStructure-from-Motion (SfM) システムです。ビデオデータに固有の時間的構造を活用することで、ビデオシーケンスからカメラのポーズ、カメラの内部パラメータを推定し、疎な3Dマップを作成するという課題に対処します。

仕組み

VidMapは、ビデオ認識フロントエンドとプロベナンス認識グローバルマッピングステージからなる2段階のパイプラインを使用します。以下の主要コンポーネントを組み合わせています:

  • Temporal Tracks: フレーム間で特徴を追跡し、一貫性を維持します。
  • Loop Closures: カメラが以前に訪れた場所に再び戻ったことを識別し、ドリフトを補正します。
  • Metric Depth: 深度予測を組み込み、スケールと幾何学的形状を提供します。
  • Global Optimization: COLMAPのグローバルマッピングパイプラインを拡張し、カメラのポーズと3Dポイントを最適化します。

対象者

このツールは、コンピュータビジョン、3D再構成、およびロボット工学の研究者や開発者、特にビデオ映像を正確な3Dマップとカメラの軌跡に変換する必要がある方を対象としています。

ハイライト

  • COLMAP Integration: 既存のCOLMAPグローバルマッピングパイプラインを拡張し、ビデオベースのSfMを向上させます。
  • GPU Acceleration: Ceres 2.3+を介してCUDAおよびcuDSSをサポートし、高速なグローバルポジショニングとバンドル調整を実現します。
  • Comprehensive Visualization: ソルバーの状態やフライスルー用に、ブラウザベースのビューアとRerunベースの再生機能が含まれています。
  • Benchmark Support: LaMAR、EuRoC、ETH3D-SLAM、CroCoDLなどのデータセットで結果を準備・評価するための組み込みツールを備えています。
  • Flexible Configuration: HydraとOmegaConfを使用し、フロントエンドとマッピングのハイパーパラメータを詳細に制御できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト