om-ai-lab/VLM-FO1

VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs

解決する課題

既存のVision-Language Models (VLMs) は、汎用的な高度な推論能力を維持しながら、細粒度な知覚(画像内の小さく特定の詳細を正確に特定し理解する能力)を実現することに苦戦することがよくあります。VLM-FO1は、学習済みモデルの汎用的な知識を消去することなく、正確な空間認識を追加することで、このギャップを埋めます。

仕組み

VLM-FO1は、既存のあらゆるVLMと統合可能なプラグアンドプレイ・モジュールです。セマンティックに富んだ特徴と知覚強化された特徴を融合させるDual-Vision Encoderアーキテクチャを備えたHybrid Region Encoder (HFRE) を使用しています。これにより、特定の領域の全体的な意味と細粒度な空間的詳細の両方を捉える「region tokens」が生成されます。モデルが元の汎用的な能力を忘却することを防ぐため、2段階のトレーニング戦略を採用しています。

対象者

オブジェクトグラウンディング、領域ベースの推論、正確なオブジェクト計数などのタスクを実行する必要がある、知覚認識型AIモデルを構築する研究者や開発者向けに設計されています。

ハイライト

  • プラグアンドプレイ: 元の重みを変更することなく、任意の学習済みVLMに追加できます。
  • 細粒度タスク: オブジェクトグラウンディング、領域生成理解、および視覚的領域推論に優れています。
  • 柔軟な統合: 高精度な検出やビデオトラッキングのために、UPNのような外部オブジェクト検出器やSAM3のようなセグメンテーションツールと連携できます。
  • 知識の保持: ベースモデルの汎用的な視覚的理解の「破滅的忘却」を避けるように特別にトレーニングされています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト