bytedance/Sa2VA

Official Repo For Pixel-LLM Codebase: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1-st solution for LSVOS)

📚 Sa2VA란 무엇인가요?

Sa2VA (*"Sa-to-VA"*라고 발음함)는 ByteDance에서 개발한 연구용 코드베이스로, 최첨단 세그멘테이션 모델인 SAM-2와 InternVL2.5/3 및 Qwen-VL과 같은 **멀티모달 대규모 언어 모델(MLLMs)**을 결합합니다. 목표는 LLM에 이미지와 비디오에 대한 픽셀 수준의 인지 능력을 부여하여 다음과 같은 작업을 가능하게 하는 것입니다:

  • 정확한 영역 참조 (referring segmentation) - 사진이나 비디오 내의 특정 영역을 지칭합니다.
  • 근거 기반 대화(grounded conversations) 수행 - 모델이 즉석에서 시각적 콘텐츠를 가리키거나, 마스크를 생성하거나, 편집할 수 있습니다.
  • 시각적 프롬프팅(visual prompting) 지원 - 사용자가 마스크나 바운딩 박스를 제공하면 모델이 그 의도를 이해합니다.
  • 이미지/비디오 채팅 인터페이스 구현 - 텍스트 전용 채팅만큼 자연스러운 경험을 제공합니다.

이 저장소는 핵심 Sa2VA 모델을 확장하는 관련 프로젝트들의 모음으로 구성되어 있습니다:

프로젝트 목적 주목할 만한 결과물
Sa2VA 핵심 통합 모델 (SAM-2 + MLLM). InternVL2.5/3, Qwen2.5-VL, Qwen3-VL 지원. 논문: IEEE TPAMI 2026, arXiv 2025.
VRT (Visual Reasoning Tracer) Sa2VA를 기반으로 구축된 객체 수준의 근거 기반 추론 모델. 벤치마크 VRT-Bench 및 학습 데이터셋 VRT-80k (HF dataset).
SAMTok 단 두 단어만으로 어떤 MLLM이든 마스크를 생성하거나 이해할 수 있게 하는 "mask-token" 인터페이스. CVPR 2026 논문, HuggingFace의 모델 쥬(model zoo).
SaSaSa2VA ICCV 2025 LSVOS Challenge (RVOS track)에서 1위를 차지한 세그멘테이션 증강 확장 모델.
Pixel-SAIL 픽셀 수준의 근거 기반 이해를 위한 단일 트랜스포머 접근 방식.

🚀 시작하는 방법

  1. 경량 의존성 관리자 uv 설치 (한 줄 명령어):
    curl -LsSf https://astral.sh/uv/install.sh | sh
    
  2. 환경 구축 (스크립트가 /tmp에 가상환경을 설정하고 이를 다시 연결합니다):
    bash setup_env.sh                 # 기본값: 최신 백본 모델
    # bash setup_env.sh sa2va legacy  # 이전 버전의 InternVL2.5 등을 사용하는 경우
    
    내부적으로 projects/sa2va에 있는 pyproject.tomluv.lock은 모든 전이적 의존성을 고정하여 재현 가능한 빌드를 보장합니다.
  3. 비밀 정보(secrets) 설정 (예: HuggingFace 토큰) - 템플릿을 복사하여 설정합니다:
    cp .env.example .env   # 키를 입력하여 편집
    
  4. 데모 실행 – 활성화(source projects/sa2va/.venv/bin/activate) 후, 특정 프로젝트 폴더 내부의 README(예: projects/sa2va/README.md)를 따라 추론 또는 학습을 시작합니다.

🎯 일반적인 사용 사례

사용 사례 Sa2VA가 가능하게 하는 기능
대화형 시각적 챗봇 사용자가 "빨간색 박스 안의 물체는 무엇인가요?"라고 물으면 모델이 정확한 마스크와 설명을 반환합니다.
비디오디오 편집 어시스턴트 "12-15 프레임의 사람을 흐릿하게 처리하세요"와 같은 텍스트 명령을 제공하면 시스템이 프레임 전체에 걸쳐 정확한 픽셀을 분리합니다.
근거 기반 시각적 추론 VRT-Bench를 사용하여 객체 수준의 마스크와 Chain-of-Thought 프롬프팅을 결합하여 "왜 자동차가 자전거보다 더 빨리 움직이나요?"라는 질문에 답합니다.
교차 모달 콘텐츠 생성 특정 영역 제약 조건이 포함된 이미지 생성 (예: "파란색 원이 있는 곳에 고양이를 그려주세요").

📦 저장소 구성 요소

  • projects/sa2va/ – 핵심 모델 코드, 학습 스크립트 및 추론 유틸리티.
  • projects/vrt_sa2va/ – 데이터셋 로더, 벤치마크 평가 스크립트 및 VRT-80k 데이터 준비 파이프라인.
  • projects/samtok/ – 토큰-마스크 변환 로직 및 사전 학습된 체크포인트.
  • setup_env.sh – 원클릭 환경 구축 스크립트.
  • .env.example – API 키를 위한 플레이스홀더.
  • Citation block – 세 가지 주요 논문에 대한 복사 가능한 BibTeX.

📚 더 알아보기


📝 인용 방법

@article{sa2va, 
  title={Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos}, 
  author={Yuan, Haobo and Li, Xiangtai and Zhang, Tao and Sun, Yueyi and Huang, Zilong and Xu, Shilin and Ji, Shunping and Tong, Yunhai and Qi, Lu and Feng, Jiashi and Yang, Ming-Hsuan}, 
  journal={IEEE TPAMI}, 
  year={2026}
}

결론적으로: Sa2VA는 대규모 언어 모델에 진정한 픽셀 수준의 시각 능력을 부여하는 최첨단 연구 플랫폼으로, 긴밀하게 통합된 시각-언어 에이전트, 근거 기반 추론, 차세대 멀티모달 어시스턴트의 시도로를 열어줍니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트