bytedance/Sa2VA

Official Repo For Pixel-LLM Codebase: Sa2VA (PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1-st solution for LSVOS)

解决的问题

它解决了多模态 LLM 在执行密集型像素级理解方面的局限性。虽然许多模型可以描述图像,但它们往往难以精确地定位和分割图像和视频中的特定对象或区域。

工作原理

该项目以 Sa2VA 为中心,这是一种结合了 Segment Anything Model 2 (SAM-2) 和 LLaVA (Large Language-and-Vision Assistant) 的统一模型。这种集成使模型能够在图像和视频中执行指代分割、接地对话和视觉提示。它支持包括 InternVL2.5/3 和 Qwen2.5-VL/Qwen3-VL 在内的多种骨干网络。

适用对象

致力于多模态 AI 的研究人员和开发人员,特别是那些专注于图像和视频分割、视觉接地以及 LLM 与计算机视觉交集领域的人士。

亮点

  • 统一模型:结合 SAM-2 和 LLaVA,实现密集型接地理解。
  • 多任务支持:能够进行指代分割、接地对话以及图像/视频聊天。
  • 广泛的骨干网络兼容性:适用于 InternVL 和 Qwen-VL 系列模型。
  • 扩展的生态系统:包括用于对象级推理的 VRT 和将掩码表示为 token 的 SAMTok 等相关项目。