om-ai-lab/VLM-FO1
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
解決的問題
現有的視覺語言模型 (VLMs) 在保持其通用高層推理能力的同時,往往難以實現細粒度感知——即精確定位並理解圖像中微小或特定細節的能力。VLM-FO1 透過在不擦除預訓練模型通用知識的情況下添加精確的空間意識,填補了這一空白。
工作原理
VLM-FO1 是一個可以與任何現有 VLM 集成的即插即用模組。它使用具有 Dual-Vision Encoder 架構的混合區域編碼器 (HFRE),該架構將語義豐富的特徵與增強感知特徵相結合。這創建了能夠同時捕捉特定區域的整體含義與細粒度空間細節的「region tokens」。為了防止模型遺忘其原始的通用能力,它採用了兩階段訓練策略。
適用對象
專為構建需要執行目標定位 (object grounding)、基於區域的推理與精確目標計數等任務的感知感知型 AI 模型的研究人員與開發人員設計。
亮點
- 即插即用: 可以添加到任何預訓練 VLM 中,而無需更改原始權重。
- 細粒度任務: 在目標定位、區域生成理解與視覺區域推理方面表現出色。
- 靈活集成: 可與 UPN 等外部目標檢測器或 SAM3 等分割工具配合使用,實現高保真檢測與影片追蹤。
- 知識保留: 經過專門訓練,以避免對基礎模型的通用視覺理解產生「災難性遺忘」。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案