Wakals/CoVT
[ECCV 2026] Official repo of "Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens"
解决的问题
视觉语言模型(VLM)在密集视觉感知任务——如空间推理、几何意识和精确物体定位——上常常表现不佳,因为它们主要在离散的语言空间中进行推理。CoVT 通过允许模型使用连续视觉令牌进行推理,弥合了高层语义推理与底层感知基础之间的差距。
工作原理
CoVT 引入了「视觉思维链」(Chain-of-Visual-Thought),在生成最终文本答案之前,VLM 会预测一小部分紧凑的连续视觉令牌(约 20 个)。这些令牌在训练过程中通过与轻量级视觉专家对齐,被训练为编码特定的感知线索:
- 分割(SAM): 8 个令牌用于掩码提示。
- 深度(DepthAnything): 4 个令牌用于深度重建。
- 边缘(PIDINet): 4 个令牌用于边缘结构。
- 特征(DINO): 4 个令牌用于补丁级特征。
在推理阶段,模型直接在这一潜在视觉空间中进行推理。虽然这些令牌可以解码为密集预测(如深度图或分割掩码)以供人类可读,但这一解码步骤是可选的,模型无需依赖它即可得出答案。
适用人群
需要提升空间精度、增强几何理解能力,并具备可解释推理过程的视觉中心任务的多模态 AI 研究人员和开发者。
主要亮点
- 连续视觉推理: 超越纯文本思维链,引入潜在视觉表示。
- 专家提供的线索: 利用专用模型(SAM、DINO 等)将感知知识提炼为紧凑令牌。
- 性能提升: 在 CV-Bench、MMVP 和 RealWorldQA 等基准上性能提升 3% 至 16%。
- 可解释性: 可将内部「视觉思维」解码为可视地图,用于调试或验证。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch