bytedance/Sa2VA
Official Repo For Pixel-LLM Codebase: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1-st solution for LSVOS)
📚 什么是 Sa2VA?
Sa2VA(发音为 “Sa‑to‑VA”)是字节跳动发布的一个研究级代码库,将 SAM‑2 —— 一种前沿的分割模型 —— 与多模态大语言模型(MLLMs)如 InternVL2.5/3 和 Qwen‑VL 相结合。其目标是赋予 LLMs 对图像和视频的 像素级 感知能力,使其能够:
- 精确定位区域(指代分割),在图片或视频中指明具体区域。
- 进行 基于视觉的对话,模型可实时指向、遮罩或编辑视觉内容。
- 支持 视觉提示 —— 用户可提供一个掩码或边界框,模型将理解其意图。
- 驱动 图像/视频聊天 界面,使其体验如同纯文本聊天一般自然。
该仓库组织为一系列相关项目,每个项目都扩展了核心 Sa2VA 模型:
| 项目 | 目的 | 重要成果 |
|---|---|---|
| Sa2VA | 核心统一模型(SAM‑2 + MLLM)。 | 支持 InternVL2.5/3、Qwen2.5‑VL、Qwen3‑VL。论文:IEEE TPAMI 2026,arXiv 2025。 |
| VRT(视觉推理追踪器) | 基于 Sa2VA 构建的基于对象级别的接地推理。 | 基准测试 VRT‑Bench 和训练数据集 VRT‑80k(HF 数据集)。 |
| SAMTok | 一种“掩码‑令牌”接口,使任何 MLLM 仅用两个词即可生成或理解掩码。 | CVPR 2026 论文,HuggingFace 上的模型库。 |
| SaSaSa2VA | 分割增强型扩展,在 ICCV 2025 LSVOS 挑战赛(RVOS 轨道)中获得第一名。 | |
| Pixel‑SAIL | 基于单个 Transformer 的像素级接地方法。 |
🚀 如何快速上手
- 安装轻量级依赖管理器
uv(一行命令):curl -LsSf https://astral.sh/uv/install.sh | sh - 创建环境(脚本会在
/tmp中设置虚拟环境并链接回来):
幕后,bash setup_env.sh # 默认:最新主干模型 # bash setup_env.sh sa2va legacy # 用于较旧的 InternVL2.5 等版本projects/sa2va中的pyproject.toml和uv.lock锁定了所有传递依赖,确保构建可复现。 - 配置密钥(例如 HuggingFace 令牌),通过复制模板文件:
cp .env.example .env # 用你的密钥编辑此文件 - 运行演示 —— 激活环境后(
source projects/sa2va/.venv/bin/activate),按照特定项目文件夹中的 README(例如projects/sa2va/README.md)启动推理或训练。
🎯 典型应用场景
| 应用场景 | Sa2VA 所能实现的功能 |
|---|---|
| 交互式视觉聊天机器人 | 用户可提问“红色框内的物体是什么?”,模型返回精确掩码和描述。 |
| 视频编辑助手 | 输入文本指令如“模糊第 12–15 帧中的人”,系统可跨帧精准隔离对应像素。 |
| 基于视觉的推理 | 结合对象级掩码与思维链提示,回答“为什么汽车比自行车快?”等问题,使用 VRT‑Bench。 |
| 跨模态内容创作 | 在特定区域约束下生成图像(例如“在蓝色圆圈位置画一只猫”)。 |
📦 仓库内包含的内容
projects/sa2va/– 核心模型代码、训练脚本和推理工具。projects/vrt_sa2va/– 数据集加载器、基准评估脚本和 VRT‑80k 数据准备流程。projects/samtok/– 令牌-掩码转换逻辑和预训练检查点。setup_env.sh– 一键式环境初始化脚本。.env.example– API 密钥占位符文件。- 引用区块 – 三篇主要论文的可复制 BibTeX 格式引用。
📚 更多学习资源
- 论文(TPAMI 2026) – https://ieeexplore.ieee.org/document/11640960
- arXiv 预印本 – https://arxiv.org/abs/2501.04001
- 项目主页 – https://lxtgh.github.io/project/sa2va
- 模型库 – https://huggingface.co/collections/ByteDance/sa2va-model-zoo-677e3084d71b5f108d00e093
- VRT 基准测试页 – https://harboryuan.github.io/visual-reasoning-tracer/
- SAMTok 页面 – https://zhouyiks.github.io/projects/SAMTok/
📝 如何引用
@article{sa2va,
title={Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos},
author={Yuan, Haobo and Li, Xiangtai and Zhang, Tao and Sun, Yueyi and Huang, Zilong and Xu, Shilin and Ji, Shunping and Tong, Yunhai and Qi, Lu and Feng, Jiashi and Yang, Ming‑Hsuan},
journal={IEEE TPAMI},
year={2026}
}
总结:Sa2VA 是一个前沿的研究平台,为大语言模型赋予真正的像素级视觉能力,打开了通往紧密集成的视觉-语言智能体、基于视觉的推理以及下一代多模态助手的大门。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目