Wakals/CoVT

[ECCV 2026] Official repo of "Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens"

解决的问题

视觉语言模型(VLM)在密集视觉感知任务——如空间推理、几何意识和精确物体定位——上常常表现不佳,因为它们主要在离散的语言空间中进行推理。CoVT 通过允许模型使用连续视觉令牌进行推理,弥合了高层语义推理与底层感知基础之间的差距。

工作原理

CoVT 引入了「视觉思维链」(Chain-of-Visual-Thought),在生成最终文本答案之前,VLM 会预测一小部分紧凑的连续视觉令牌(约 20 个)。这些令牌在训练过程中通过与轻量级视觉专家对齐,被训练为编码特定的感知线索:

  • 分割(SAM): 8 个令牌用于掩码提示。
  • 深度(DepthAnything): 4 个令牌用于深度重建。
  • 边缘(PIDINet): 4 个令牌用于边缘结构。
  • 特征(DINO): 4 个令牌用于补丁级特征。

在推理阶段,模型直接在这一潜在视觉空间中进行推理。虽然这些令牌可以解码为密集预测(如深度图或分割掩码)以供人类可读,但这一解码步骤是可选的,模型无需依赖它即可得出答案。

适用人群

需要提升空间精度、增强几何理解能力,并具备可解释推理过程的视觉中心任务的多模态 AI 研究人员和开发者。

主要亮点

  • 连续视觉推理: 超越纯文本思维链,引入潜在视觉表示。
  • 专家提供的线索: 利用专用模型(SAM、DINO 等)将感知知识提炼为紧凑令牌。
  • 性能提升: 在 CV-Bench、MMVP 和 RealWorldQA 等基准上性能提升 3% 至 16%。
  • 可解释性: 可将内部「视觉思维」解码为可视地图,用于调试或验证。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch