Wakals/CoVT

[ECCV 2026] Official repo of "Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens"

何を解決するか

ビジョン・ランゲージモデル(VLM)は、空間的推論、幾何認識、正確なオブジェクト位置特定などの密集した視覚的認識タスクにおいて困難を抱えることが多く、主に離散的な言語空間で推論を行うためです。CoVTは、連続的な視覚トークンを使用した推論を可能にすることで、高レベルの意味的推論と低レベルの知覚的根拠の間のギャップを埋めます。

仕組み

CoVTは「視覚的思考の連鎖(Chain-of-Visual-Thought)」を導入し、最終的なテキスト回答を生成する前に、小さな集合(約20個)のコンパクトな連続的視覚トークンを予測します。これらのトークンは、トレーニング中に軽量なビジョンエキスパートと一致させることで、特定の知覚的手がかりを符号化するように訓練されます:

  • セグメンテーション(SAM): マスクプロンプト用に8トークン。
  • 深度(DepthAnything): 深度再構成用に4トークン。
  • エッジ(PIDINet): エッジ構造用に4トークン。
  • 特徴(DINO): パッチレベルの特徴用に4トークン。

推論時、モデルはこの潜在視覚空間で直接推論を行います。これらのトークンは、深度マップやセグメンテーションマスクなどの密な予測にデコードできるため、人間が理解しやすい形になりますが、モデルが答えに到達するためにこのデコードステップは必須ではありません。

対象ユーザー

視覚中心のタスクにおいて、空間的精度の向上、幾何的理解の強化、より解釈可能な推論プロセスを必要とするマルチモーダルAIの研究者や開発者。

主な特徴

  • 連続的視覚推論: テキストのみの思考チェーンから脱却し、潜在的な視覚表現を含む推論を実現。
  • エキスパートからの手がかり: SAM、DINOなど専門モデルを活用し、知覚知識をコンパクトなトークンに抽出。
  • パフォーマンス向上: CV-Bench、MMVP、RealWorldQAなどのベンチマークで3%~16%の性能向上を達成。
  • 解釈可能性: 内部の「視覚的思考」を可視化可能なマップにデコード可能で、デバッグや検証に利用可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch