om-ai-lab/VLM-FO1
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
解決する課題
既存のVision-Language Models (VLMs) は、汎用的な高度な推論能力を維持しながら、細粒度な知覚(画像内の小さく特定の詳細を正確に特定し理解する能力)を実現することに苦戦することがよくあります。VLM-FO1は、学習済みモデルの汎用的な知識を消去することなく、正確な空間認識を追加することで、このギャップを埋めます。
仕組み
VLM-FO1は、既存のあらゆるVLMと統合可能なプラグアンドプレイ・モジュールです。セマンティックに富んだ特徴と知覚強化された特徴を融合させるDual-Vision Encoderアーキテクチャを備えたHybrid Region Encoder (HFRE) を使用しています。これにより、特定の領域の全体的な意味と細粒度な空間的詳細の両方を捉える「region tokens」が生成されます。モデルが元の汎用的な能力を忘却することを防ぐため、2段階のトレーニング戦略を採用しています。
対象者
オブジェクトグラウンディング、領域ベースの推論、正確なオブジェクト計数などのタスクを実行する必要がある、知覚認識型AIモデルを構築する研究者や開発者向けに設計されています。
ハイライト
- プラグアンドプレイ: 元の重みを変更することなく、任意の学習済みVLMに追加できます。
- 細粒度タスク: オブジェクトグラウンディング、領域生成理解、および視覚的領域推論に優れています。
- 柔軟な統合: 高精度な検出やビデオトラッキングのために、UPNのような外部オブジェクト検出器やSAM3のようなセグメンテーションツールと連携できます。
- 知識の保持: ベースモデルの汎用的な視覚的理解の「破滅的忘却」を避けるように特別にトレーニングされています。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト