lxtGH/OMG-Seg
Official Repo For OMG-LLaVA and OMG-Seg codebase [CVPR-24 and NeurIPS-24]
What it solves
OMG-Seg 和 OMG-LLaVA 旨在用一个能够处理广泛视觉感知与推理任务的单一、统一模型,取代多个专门的视觉模型。这些框架不使用大语言模型 (LLM) 来协调多个专门的模型,而是为像素级理解与推理提供端到端的解决方案。
How it works
- OMG-Seg: 一种基于 Transformer 的编码器-解码器架构,使用任务特定的查询 (queries) 和输出,来处理超过十种不同的分割任务 (包括图像和视频的语义分割、实例分割和全景分割,以及开放词汇和交互式分割)。
- OMG-LLaVA: 将通用分割方法作为视觉编码器与 LLM 结合。它集成了图像信息、感知先验 (priors) 和视觉提示 (prompts) into tokens,让 LLM 根据用户指令提供文本响应和像素级分割结果。
Who it’s for
专注于计算机视觉与多模态 LLM 的研究人员和学术实验室,特别是那些对降低计算开销并简化密集预测任务的模型架构感兴趣的人。
Highlights
- Unified Architecture: 支持在一次训练中对多种密集预测任务进行联合共同训练。
- Unified Segmentation: OMG-Seg 处理图像、视频和开放词汇分割,均在单一模型中完成。
- Efficiency: OMG-Seg 仅使用 70M 可训练参数,且可以在单个 32GB V100 或 40GB A100 GPU 上复现。
- End-to-End: 在单一代码库中桥接了图像级、对象级和像素级推理与推理。
相关
- 项目
- 项目
- 项目
- 项目