facebookresearch/vggt-omega
[CVPR 2026 Oral] VGGT Omega
解決的問題
VGGT-Ω 提供了一種從一組影像中估計相機姿態與深度的方法,使得以從二維視覺資料重建三維場景。
工作原理
本專案使用一個預訓練的基於 Transformer 的模型(提供 1B 參數版本),以影像作為輸入,預測姿態編碼、深度圖與深度可信度。這些預測結果隨後轉換為相機外參與內參,生成三維點群並以 GLB 檔案形式可視化場景。
適用對象
專為從事電腦視覺、三維重建與空間人工智慧的研究人員與開發者設計。
主要亮點
- 端對端推論:從影像中同時預測相機參數與深度。
- 文字對齊支援:提供專用的檢查點,適用於文字對齊嵌入。
- 三維可視化:包含一個 Gradio 示範,可將未反投影的點群與預測的相機可視化為 GLB 場景。
- 可擴展的記憶體使用:提供處理不同數量輸入幀時的 GPU 記憶體使用詳細基準。
相關
- 專案
- 專案
- 專案
- 專案
- 專案