mbzuai-oryx/groundingLMM

[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), the first-of-its-kind model capable of generating natural language responses that are seamlessly integrated with object segmentation masks.

解决的问题

GLaMM 解决了大型多模态模型 (LMM) 在提供精确、像素级视觉定位方面的局限性。它不仅能使模型描述图像,还能生成精确识别其自然语言响应中提及的对象的分割掩码。

工作原理

GLaMM 是一个端到端训练的多模态模型,能够处理图像级和感兴趣区域输入。它将自然语言生成与对象分割掩码相结合,使其能够执行一项名为 Grounded Conversation Generation (GCG) 的统一任务。该过程允许模型将短语定位、指代表达分割和视觉语言对话结合到单一交互中。

适用人群

从事计算机视觉和自然语言处理的研究人员和开发者,他们需要一个具备详细区域级理解、像素级定位和对话式 AI 能力的模型。

亮点

  • Grounded Conversation Generation:一项新任务,用于创建与分割掩码相关联的图像级描述。
  • GranD Dataset:一个大规模数据集,包含 750 万个独特概念,这些概念基于 8.1 亿个带有分割掩码的区域。
  • 多功能应用:能够执行指代表达分割、区域级描述和高质量图像描述。
  • 多粒度交互:支持多个层级的交互,从整个图像到特定的感兴趣区域。

相关

  • 项目
  • 项目
  • 项目
  • 项目