facebookresearch/vggt-omega

[CVPR 2026 Oral] VGGT Omega

解決的問題

VGGT-Ω 提供了一種從一組影像中估計相機姿態與深度的方法,使得以從二維視覺資料重建三維場景。

工作原理

本專案使用一個預訓練的基於 Transformer 的模型(提供 1B 參數版本),以影像作為輸入,預測姿態編碼、深度圖與深度可信度。這些預測結果隨後轉換為相機外參與內參,生成三維點群並以 GLB 檔案形式可視化場景。

適用對象

專為從事電腦視覺、三維重建與空間人工智慧的研究人員與開發者設計。

主要亮點

  • 端對端推論:從影像中同時預測相機參數與深度。
  • 文字對齊支援:提供專用的檢查點,適用於文字對齊嵌入。
  • 三維可視化:包含一個 Gradio 示範,可將未反投影的點群與預測的相機可視化為 GLB 場景。
  • 可擴展的記憶體使用:提供處理不同數量輸入幀時的 GPU 記憶體使用詳細基準。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案