facebookresearch/VLM3
Official implementation of paper "VLM³: Vision Language Models Are Native 3D Learners".
解決的問題
VLM³ 解決了 3D 視覺任務的複雜性。傳統上,要達成 3D 理解的高表現,需要專用架構、複雜的損失函數以及大量資料增強。VLM³ 表明,標準的視覺語言模型(VLM)無需這些特殊附加元件,也能有效執行這些任務。
工作原理
本專案使用標準 VLM 架構(特別是基於 Qwen3-vl-4B)並透過監督微調(SFT)在統一的文本輸出領域中進行訓練。為處理 3D 任務,採用了兩項關鍵技術:
- 焦距歸一化:將輸入影像進行縮放,使所有影像的焦距保持一致,從而無需額外編碼器即可消除相機模糊性。
- 歸一化座標引用:模型使用基於文字的歸一化座標(例如 [0, 2000) 或 [0, 1000))來引用物件或像素,從而無需標記渲染或架構變更。
適用對象
專為從事 3D 視覺、深度估計與相機位姿估計的研究人員與開發者設計,希望使用基礎模型以更可擴展、更簡單的方式進行 3D 學習。
主要亮點
- 無需架構變更:無需自訂預測頭或路由機制,可直接使用標準 VLM 架構與損失函數。
- 高表現:在度量深度估計、像素對應與相機位姿估計方面,表現達到或超越當前最先進模型。
- 簡化流程:無需複雜的資料增強操作,如旋轉、平移或外觀增強。
- 統一輸出:使用簡單的文本輸出實現 3D 空間推理。
相關
- Dispatch
- 專案
- 專案
- 專案
- Dispatch