bytedance/Sa2VA
Official Repo For Pixel-LLM Codebase: Sa2VA (PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1-st solution for LSVOS)
解決的問題
它解決了多模態 LLM 在執行密集型像素級理解方面的局限性。雖然許多模型可以描述圖像,但它們往往難以精確地定位與分割圖像和影片中的特定物件或區域。
工作原理
該專案以 Sa2VA 為中心,這是一個結合了 Segment Anything Model 2 (SAM-2) 與 LLaVA (Large Language-and-Vision Assistant) 的統一模型。這種整合使模型能夠在圖像與影片中執行指代分割、接地對話與視覺提示。它支援包括 InternVL2.5/3 與 Qwen2.5-VL/Qwen3-VL 在內的各種骨幹網路。
適用對象
致力於多模態 AI 的研究人員與開發人員,特別是那些專注於圖像與影片分割、視覺接地,以及 LLM 與電腦視覺交集領域的人士。
亮點
- 統一模型:結合 SAM-2 與 LLaVA,實現密集型接地理解。
- 多任務支援:能夠進行指代分割、接地對話以及圖像/影片聊天。
- 廣泛的骨幹網路相容性:適用於 InternVL 與 Qwen-VL 系列模型。
- 擴展的生態系統:包括用於物件級推理的 VRT 以及將遮罩表示為 token 的 SAMTok 等相關專案。