mbzuai-oryx/groundingLMM

[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), the first-of-its-kind model capable of generating natural language responses that are seamlessly integrated with object segmentation masks.

解決する課題

GLaMM は、大規模マルチモーダルモデル (LMM) における正確でピクセルレベルの視覚的グラウンディングの提供という限界を解決します。モデルが画像を説明するだけでなく、自然言語応答で言及されたオブジェクトを正確に特定するセグメンテーションマスクを生成できるようにします。

仕組み

GLaMM は、画像レベルと関心領域の両方の入力を処理できるエンドツーエンドでトレーニングされたマルチモーダルモデルです。自然言語生成とオブジェクトセグメンテーションマスクを統合しており、Grounded Conversation Generation (GCG) と呼ばれる統一タスクを実行できます。このプロセスにより、モデルはフレーズグラウンディング、参照表現セグメンテーション、およびビジョン言語会話を単一のインタラクションに組み合わせることができます。

対象者

コンピュータビジョンと自然言語処理に取り組む研究者や開発者で、詳細な領域レベルの理解、ピクセルレベルのグラウンディング、および会話型 AI が可能なモデルを必要とする方。

ハイライト

  • Grounded Conversation Generation: セグメンテーションマスクに関連付けられた画像レベルのキャプションを作成する新しいタスク。
  • GranD Dataset: セグメンテーションマスクを持つ8億1000万の領域に基づいた、750万のユニークな概念を特徴とする大規模データセット。
  • 多用途なアプリケーション: 参照表現セグメンテーション、領域レベルのキャプショニング、および高品質な画像キャプショニングが可能。
  • 多粒度インタラクション: 画像全体から特定の関心領域まで、複数のレベルでのインタラクションをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト