Wakals/CoVT

[ECCV 2026] Official repo of "Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens"

解決的問題

視覺-語言模型(VLM)在密集的視覺感知任務——例如空間推理、幾何意識與精確的物件定位——上經常表現不佳,這是因為它們主要在離散的語言空間中進行推理。CoVT 透過允許模型使用連續視覺令牌進行推理,彌補了高階語意推理與底層感知基礎之間的差距。

工作原理

CoVT 引入了「視覺思考鏈」(Chain-of-Visual-Thought),在產生最終文字答案之前,VLM 會預測一小組緊湊的連續視覺令牌(約 20 個)。這些令牌在訓練過程中透過與輕量級視覺專家對齊,被訓練為編碼特定的感知線索:

  • 分割(SAM): 8 個令牌用於遮罩提示。
  • 深度(DepthAnything): 4 個令牌用於深度重建。
  • 邊緣(PIDINet): 4 個令牌用於邊緣結構。
  • 特徵(DINO): 4 個令牌用於補丁級特徵。

在推論階段,模型直接在這個潛在視覺空間中進行推理。雖然這些令牌可以解碼為密集預測(如深度圖或分割遮罩)以供人類可讀,但此解碼步驟是可選的,模型無需依賴它即可得出答案。

適用對象

需要提升空間精確度、增強幾何理解能力,並具備可解釋推理過程的視覺導向任務之多模態 AI 研究人員與開發者。

主要亮點

  • 連續視覺推理: 超越純文字思考鏈,引入潛在視覺表示。
  • 專家提供的線索: 利用專用模型(SAM、DINO 等)將感知知識精煉為緊湊令牌。
  • 性能提升: 在 CV-Bench、MMVP 和 RealWorldQA 等基準上性能提升 3% 至 16%。
  • 可解釋性: 可將內部「視覺思考」解碼為可視地圖,用於除錯或驗證。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch