apple-aiml-research/ml-matrix3d

[CVPR 2025 Highlight] Matrix3D: Large Photogrammetry Model All-in-One

解決的問題

Matrix3D 提供了一個統一的攝影測量模型,取代了以往需使用多個專用模型來處理不同3D視覺任務的必要性。使用者即使從無姿態影像或單一視角開始,也能在單一框架內執行姿態估計、深度預測與新視角合成。

工作原理

該系統使用一個大型攝影測量模型,透過遮罩推論動態切換或組合不同任務。透過操控模態旗標與視角識別符,模型可處理各種輸入狀態(如單張影像或多張已定位影像),以預測3D屬性。這些輸出隨後可輸入至修改過的3D高斯潑濺(3DGS)流程,生成完整的3D重構。

適用對象

本工具專為從事電腦視覺與3D重構的研究人員及開發者設計,適用於需要從有限影像資料中靈活估計相機姿態、預測深度或合成新視角的使用者。

主要亮點

  • 一體化架構:單一模型即可處理姿態估計、深度預測與新視角合成。
  • 彈性輸入:支援從單一視角到3D重構,再到無姿態少樣本3D重構的任務。
  • 3DGS整合:內建修改過的3D高斯潑濺(3DGS)流程,將模型預測轉換為3D場景。
  • 遮罩推論:可根據輸入配置動態組合攝影測量子任務。

相關

  • 專案
  • 專案
  • 專案
  • 專案