om-ai-lab/VLM-FO1

VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs

解決的問題

現有的視覺語言模型 (VLMs) 在保持其通用高層推理能力的同時,往往難以實現細粒度感知——即精確定位並理解圖像中微小或特定細節的能力。VLM-FO1 透過在不擦除預訓練模型通用知識的情況下添加精確的空間意識,填補了這一空白。

工作原理

VLM-FO1 是一個可以與任何現有 VLM 集成的即插即用模組。它使用具有 Dual-Vision Encoder 架構的混合區域編碼器 (HFRE),該架構將語義豐富的特徵與增強感知特徵相結合。這創建了能夠同時捕捉特定區域的整體含義與細粒度空間細節的「region tokens」。為了防止模型遺忘其原始的通用能力,它採用了兩階段訓練策略。

適用對象

專為構建需要執行目標定位 (object grounding)、基於區域的推理與精確目標計數等任務的感知感知型 AI 模型的研究人員與開發人員設計。

亮點

  • 即插即用: 可以添加到任何預訓練 VLM 中,而無需更改原始權重。
  • 細粒度任務: 在目標定位、區域生成理解與視覺區域推理方面表現出色。
  • 靈活集成: 可與 UPN 等外部目標檢測器或 SAM3 等分割工具配合使用,實現高保真檢測與影片追蹤。
  • 知識保留: 經過專門訓練,以避免對基礎模型的通用視覺理解產生「災難性遺忘」。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案