bytedance/Sa2VA

Official Repo For Pixel-LLM Codebase: Sa2VA (PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1-st solution for LSVOS)

解決する課題

マルチモーダルLLMが持つ、高密度なピクセルレベルの理解における限界を解決します。多くのモデルは画像を説明することはできますが、画像や動画内の特定のオブジェクトや領域を正確に特定し、セグメンテーションすることには苦戦することがよくあります。

仕組み

このプロジェクトは、Segment Anything Model 2 (SAM-2) と LLaVA (Large Language-and-Vision Assistant) を組み合わせた統合モデルである Sa2VA を中心としています。この統合により、モデルは画像と動画の両方において、参照セグメンテーション、グラウンディング会話、およびビジュアルプロンプティングを実行できるようになります。InternVL2.5/3 や Qwen2.5-VL/Qwen3-VL を含む様々なバックボーンをサポートしています。

対象者

マルチモーダルAIの研究者や開発者、特に画像・動画セグメンテーション、ビジュアルグラウンディング、およびLLMとコンピュータビジョンの交差点に焦点を当てている方を対象としています。

ハイライト

  • 統合モデル: SAM-2とLLaVAを組み合わせ、高密度なグラウンディング理解を実現。
  • マルチタスク対応: 参照セグメンテーション、グラウンディング会話、画像/動画チャットが可能。
  • 幅広いバックボーン互換性: InternVLおよびQwen-VLシリーズのモデルに対応。
  • 拡張されたエコシステム: オブジェクトレベルの推論を行うVRTや、マスクをトークンとして表現するSAMTokなどの関連プロジェクトを含む。