Wakals/CoVT
[ECCV 2026] Official repo of "Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens"
解決的問題
視覺-語言模型(VLM)在密集的視覺感知任務——例如空間推理、幾何意識與精確的物件定位——上經常表現不佳,這是因為它們主要在離散的語言空間中進行推理。CoVT 透過允許模型使用連續視覺令牌進行推理,彌補了高階語意推理與底層感知基礎之間的差距。
工作原理
CoVT 引入了「視覺思考鏈」(Chain-of-Visual-Thought),在產生最終文字答案之前,VLM 會預測一小組緊湊的連續視覺令牌(約 20 個)。這些令牌在訓練過程中透過與輕量級視覺專家對齊,被訓練為編碼特定的感知線索:
- 分割(SAM): 8 個令牌用於遮罩提示。
- 深度(DepthAnything): 4 個令牌用於深度重建。
- 邊緣(PIDINet): 4 個令牌用於邊緣結構。
- 特徵(DINO): 4 個令牌用於補丁級特徵。
在推論階段,模型直接在這個潛在視覺空間中進行推理。雖然這些令牌可以解碼為密集預測(如深度圖或分割遮罩)以供人類可讀,但此解碼步驟是可選的,模型無需依賴它即可得出答案。
適用對象
需要提升空間精確度、增強幾何理解能力,並具備可解釋推理過程的視覺導向任務之多模態 AI 研究人員與開發者。
主要亮點
- 連續視覺推理: 超越純文字思考鏈,引入潛在視覺表示。
- 專家提供的線索: 利用專用模型(SAM、DINO 等)將感知知識精煉為緊湊令牌。
- 性能提升: 在 CV-Bench、MMVP 和 RealWorldQA 等基準上性能提升 3% 至 16%。
- 可解釋性: 可將內部「視覺思考」解碼為可視地圖,用於除錯或驗證。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch