Wakals/CoVT

[ECCV 2026] Official repo of "Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens"

해결하는 문제

비전-언어 모델(VLM)은 공간적 추론, 기하학적 인식, 정밀한 객체 위치 추정과 같은 밀집된 시각 인식 작업에서 어려움을 겪는 경우가 많습니다. 그 이유는 주로 이산적인 언어 공간에서 추론하기 때문입니다. CoVT는 모델이 연속적인 시각 토큰을 사용해 추론할 수 있도록 하여, 고수준의 의미적 추론과 저수준의 지각적 기반 사이의 격차를 메웁니다.

작동 방식

CoVT는 '시각적 사고의 사슬(Chain-of-Visual-Thought)'을 도입하여, 최종 텍스트 답변을 생성하기 전에 작고 컴팩트한 연속적 시각 토큰(약 20개)의 소량을 예측합니다. 이 토큰들은 훈련 중에 가벼운 비전 전문가와 일치시켜 특정 지각적 신호를 인코딩하도록 훈련됩니다:

  • 세그멘테이션 (SAM): 마스크 프롬프트용 8개 토큰.
  • 깊이 (DepthAnything): 깊이 재구성용 4개 토큰.
  • 경계 (PIDINet): 경계 구조용 4개 토큰.
  • 특징 (DINO): 패치 수준 특징용 4개 토큰.

추론 시 모델은 이 잠재 시각 공간에서 직접 추론합니다. 이러한 토큰들은 깊이 맵이나 세그멘테이션 마스크와 같은 밀집 예측으로 디코딩할 수 있어 인간이 이해하기 쉬운 형태로 제공되지만, 모델이 답에 도달하기 위해 이 디코딩 단계가 반드시 필요한 것은 아닙니다.

대상 사용자

시각 중심 작업에서 공간 정밀도 향상, 기하학적 이해 개선, 더 해석 가능한 추론 과정이 필요한 멀티모달 AI 연구자 및 개발자.

주요 특징

  • 연속적 시각 추론: 텍스트 중심 사고 체인을 넘어서 잠재적 시각 표현을 포함한 추론을 가능하게 함.
  • 전문가로부터의 신호: SAM, DINO 등 전문 모델을 활용해 지각 지식을 컴팩트한 토큰으로 추출.
  • 성능 향상: CV-Bench, MMVP, RealWorldQA와 같은 벤치마크에서 3%~16% 성능 향상.
  • 해석 가능성: 내부 '시각적 사고'를 시각화 가능한 맵으로 디코딩 가능해 디버깅이나 검증에 활용 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch