facebookresearch/map-anything

MapAnything: Universal Feed-Forward Metric 3D Reconstruction

解決的問題

MapAnything 為度量 3D 重建提供了一個通用框架。它解決了使用單個統一的前饋模型,而非為每個任務使用單獨的專用工具來執行各種 3D 任務(如多圖像運動恢復結構 (SfM)、多視圖立體視覺、單目度量深度估計和配準)的挑戰。

工作原理

該項目的核心是使用端到端訓練的 Transformer 模型來回歸場景的分解度量 3D 幾何。它的輸入具有高度靈活性,允許用戶提供圖像、相機標定(內參或射線方向)、相機姿態或深度圖的任何組合。該框架採用模組化設計,這意味著它可以透過統一的介面封裝其他 3D 重建模型(如 DUSt3R、MASt3R 和 VGGT),確保所有輸出都遵循一致的格式(例如 3D 點、相機姿態和置信度分數)。

適用對象

該框架旨在為從事 3D 電腦視覺、機器人技術和空間 AI 研究與開發的專業人員提供服務,他們需要一個通用的工具來處理不同輸入模態下的度量 3D 重建。

亮點

  • 通用模型:支持 12 種以上不同 3D 重建任務的單個前饋模型。
  • 多模態靈活性:支持圖像、標定、深度和姿態的任何組合作為輸入。
  • 模組化設計:用於可互換使用各種外部 3D 重建模型的統一介面。
  • 記憶體高效:包含一種記憶體高效的推理模式,能夠在高端 GPU 上處理多達 2,000 個視圖。
  • 全面技術棧:提供包括數據處理、訓練、推理和分析在內的完整流水線。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案