mbzuai-oryx/groundingLMM

[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), the first-of-its-kind model capable of generating natural language responses that are seamlessly integrated with object segmentation masks.

解決的問題

GLaMM 解決了大型多模態模型 (LMM) 在提供精確、像素級視覺定位方面的限制。它不僅能讓模型描述影像,還能生成分割遮罩,精確識別其自然語言回應中提到的物件。

運作方式

GLaMM 是一個端到端訓練的多模態模型,能夠處理影像級別和感興趣區域的輸入。它將自然語言生成與物件分割遮罩整合在一起,使其能夠執行一個名為 Grounded Conversation Generation (GCG) 的統一任務。這個過程讓模型能將短語定位、指稱表達分割以及視覺語言對話結合到單一互動中。

適用對象

從事電腦視覺和自然語言處理的研究人員與開發者,他們需要一個能夠進行詳細區域級理解、像素級定位和對話式 AI 的模型。

亮點

  • Grounded Conversation Generation:一個新任務,用於創建與分割遮罩相關聯的影像級標題。
  • GranD Dataset:一個大規模資料集,包含 750 萬個獨特概念,這些概念基於 8.1 億個帶有分割遮罩的區域。
  • 多功能應用:能夠執行指稱表達分割、區域級標題生成以及高品質影像標題生成。
  • 多粒度互動:支援多個層級的互動,從整個影像到特定的感興趣區域。

相關

  • 專案
  • 專案
  • 專案
  • 專案