bytedance/Sa2VA
Official Repo For Pixel-LLM Codebase: Sa2VA (PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1-st solution for LSVOS)
해결하는 문제
멀티모달 LLM이 고밀도 픽셀 수준의 이해를 수행하는 데 있어 겪는 한계를 해결합니다. 많은 모델이 이미지를 설명할 수는 있지만, 이미지와 비디오 내의 특정 객체나 영역을 정확하게 위치시키고 세그멘테이션하는 데 어려움을 겪는 경우가 많습니다.
작동 원리
이 프로젝트는 Segment Anything Model 2 (SAM-2)와 LLaVA (Large Language-and-Vision Assistant)를 결합한 통합 모델인 Sa2VA를 중심으로 합니다. 이러한 통합을 통해 모델은 이미지와 비디오 모두에서 참조 세그멘테이션, 그라운딩 대화 및 비주얼 프롬프팅을 수행할 수 있습니다. InternVL2.5/3 및 Qwen2.5-VL/Qwen3-VL를 포함한 다양한 백본을 지원합니다.
대상
멀티모달 AI를 연구하는 연구자 및 개발자, 특히 이미지 및 비디오 세그멘테이션, 비주얼 그라운딩, 그리고 LLM과 컴퓨터 비전의 교차점에 집중하는 분들을 위한 프로젝트입니다.
주요 특징
- 통합 모델: SAM-2와 LLaVA를 결합하여 고밀도 그라운딩 이해를 실현.
- 멀티태스크 지원: 참조 세그멘테이션, 그라운딩 대화, 이미지/비디오 채팅 가능.
- 폭넓은 백본 호환성: InternVL 및 Qwen-VL 시리즈 모델과 연동.
- 확장된 생태계: 객체 수준의 추론을 위한 VRT 및 마스크를 토큰으로 표현하는 SAMTok과 같은 관련 프로젝트 포함.