bytedance/Sa2VA

Official Repo For Pixel-LLM Codebase: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1-st solution for LSVOS)

📚 什麼是 Sa2VA

Sa2VA (發音為 “Sa‑to‑VA”) 是來自 ByteDance 的研究級代碼庫,它將 SAM‑2(一種最先進的分隔模型)與 多模態大語言模型 (MLLMs)(例如 InternVL2.5/3 和 Qwen‑VL)相結合。其目標是賦予 LLM 對圖像和影片的 像素級 感知能力,使其能夠:

  • 指涉確切區域(指涉分割)在圖片或影片中。
  • 進行 具身對話 (grounded conversations),模型可以即時指向、遮罩或編輯視覺內容。
  • 支持 視覺提示 (visual prompting) – 用戶可以提供遮罩或邊界框,模型將理解其意圖。
  • 圖像/影片聊天 介面提供動力,使其感覺像純文本聊天一樣自然。

該存儲庫組織為一系列相關項目的集合,每個項目都擴展了核心的 Sa2VA 模型:

Project Purpose Notable Artefacts
Sa2VA 核心統一模型 (SAM‑2 + MLLM)。 支持 InternVL2.5/3, Qwen2.5‑VL, Qwen3‑VL。論文:IEEE TPAMI 2026, arXiv 2025。
VRT (Visual Reasoning Tracer) 基於 Sa2VA 的物件級具身推理。 基準測試 VRT‑Bench 和訓練集 VRT‑80k (HF dataset)。
SAMTok 一種 “mask‑token” 介面,讓任何 MLLM 僅用兩個單詞即可生成或理解遮罩。 CVPR 2026 論文,HuggingFace 上的模型庫。
SaSaSa2VA 分隔增強擴展,在 ICCV 2025 LSVOS Challenge (RVOS track) 中獲得第一名。
Pixel‑SAIL 單一 Transformer 方法實現像素級具身化。

🚀 如何開始使用

  1. 安裝輕量級依賴管理器 uv (單行指令):
    curl -LsSf https://astral.sh/uv/install.sh | sh
    
  2. 建立環境 (腳本會在 /tmp 中設置 virtualenv 並將其連結回原處):
    bash setup_env.sh                 # 預設:最新 backbone 模型
    # bash setup_env.sh sa2va legacy  # 用於較舊的 InternVL2.5 等。
    
    在幕後projects/sa2va 中的 pyproject.tomluv.lock 鎖定了每個遞歸依賴,保證了可重現的構建。
  3. 配置機密資訊 (例如 HuggingFace token) 藉由複製模板:
    cp .env.example .env   # 使用您的金鑰進行編輯
    
  4. 執行演示 – 在激活環境後 (source projects/sa2va/.venv/bin/activate),請遵循特定項目資料夾內的 README (例如 projects/sa2va/README.md) 來啟動推理或訓練。

🎯 典型使用場景

Use case What Sa2VA enables
互動式視覺聊天機器人 用戶可以問 “什麼是紅框中的物件?”,模型會返回精確的遮罩和描述。
影片編輯助手 提供文本指令,例如 “模糊第 12-15 幀的行人”,系統會隔離各幀中的確切像素。
具身視覺推理 結合物件級遮罩與思維鏈提示,使用 VRT‑Bench 回答 “為什麼汽車比自行車移動得更快?”。
跨模態內容創作 生成具有特定區域限制的圖像 (例如 “在藍色圓圈處畫一隻貓”)。

📦 存儲庫內容

  • projects/sa2va/ – 核心模型代碼、訓練腳本和推理工具。
  • projects/vrt_sa2va/ – 數據集加載器、基準測試評估腳本和 VRT‑80k 數據準備流程。
  • projects/samtok/ – token‑mask 轉換邏輯和預訓練權重。
  • setup_env.sh – 一鍵式環境啟動腳本。
  • .env.example – API 金鑰的佔位符。
  • Citation block – 準備好直接複製的 BibTeX,用於三個主要論文。

📚 學習更多資訊


📝 如何引用

@article{sa2va, 
  title={Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos}, 
  author={Yuan, Haobo and Li, Xiangtai and Zhang, Tao and Sun, Yueyi and Huang, Zilong and Xu, Shilin and Ji, Shunping and Tong, Yunhai and Qi, Lu and Feng, Jiashi and Yang, Ming‑Hsuan}, 
  journal={IEEE TPAMI}, 
  year={2026}
}

底線: Sa2VA 是一個尖端的研究平台,它賦予大語言模型真正的像素級視覺能力,為緊密集成的視覺‑語言代理、具身推理和下一代多模態助手開啟了門戶。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案