mbzuai-oryx/groundingLMM
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), the first-of-its-kind model capable of generating natural language responses that are seamlessly integrated with object segmentation masks.
解决的问题
GLaMM 解决了大型多模态模型 (LMM) 在提供精确、像素级视觉定位方面的局限性。它不仅能使模型描述图像,还能生成精确识别其自然语言响应中提及的对象的分割掩码。
工作原理
GLaMM 是一个端到端训练的多模态模型,能够处理图像级和感兴趣区域输入。它将自然语言生成与对象分割掩码相结合,使其能够执行一项名为 Grounded Conversation Generation (GCG) 的统一任务。该过程允许模型将短语定位、指代表达分割和视觉语言对话结合到单一交互中。
适用人群
从事计算机视觉和自然语言处理的研究人员和开发者,他们需要一个具备详细区域级理解、像素级定位和对话式 AI 能力的模型。
亮点
- Grounded Conversation Generation:一项新任务,用于创建与分割掩码相关联的图像级描述。
- GranD Dataset:一个大规模数据集,包含 750 万个独特概念,这些概念基于 8.1 亿个带有分割掩码的区域。
- 多功能应用:能够执行指代表达分割、区域级描述和高质量图像描述。
- 多粒度交互:支持多个层级的交互,从整个图像到特定的感兴趣区域。
相关
- 项目
- 项目
- 项目
- 项目