om-ai-lab/VLM-FO1
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
解决的问题
现有的视觉语言模型 (VLMs) 在保持其通用高层推理能力的同时,往往难以实现细粒度感知——即精确定位并理解图像中微小或特定细节的能力。VLM-FO1 通过在不擦除预训练模型通用知识的情况下添加精确的空间意识,填补了这一空白。
工作原理
VLM-FO1 是一个可以与任何现有 VLM 集成的即插即用模块。它使用具有 Dual-Vision Encoder 架构的混合区域编码器 (HFRE),该架构将语义丰富的特征与增强感知特征相结合。这创建了能够同时捕捉特定区域的整体含义和细粒度空间细节的“region tokens”。为了防止模型遗忘其原始的通用能力,它采用了两阶段训练策略。
适用对象
专为构建需要执行目标定位 (object grounding)、基于区域的推理和精确目标计数等任务的感知感知型 AI 模型的研究人员和开发人员设计。
亮点
- 即插即用: 可以添加到任何预训练 VLM 中,而无需更改原始权重。
- 细粒度任务: 在目标定位、区域生成理解和视觉区域推理方面表现出色。
- 灵活集成: 可与 UPN 等外部目标检测器或 SAM3 等分割工具配合使用,实现高保真检测和视频跟踪。
- 知识保留: 经过专门训练,以避免对基础模型的通用视觉理解产生“灾难性遗忘”。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目