HarborYuan/ovsam

[ECCV 2024] The official code of paper "Open-Vocabulary SAM".

何を解決するか

Open-Vocabulary SAM (OVSAM) は、Segment Anything Model (SAM) の制限を克服し、数千のクラスにわたるオープンボリューム設定で、物体のセグメンテーションだけでなく認識も可能にする。同時にインタラクティブなセグメンテーションと認識が可能である。

仕組み

OVSAM は、SAM と CLIP の強みを組み合わせるために、2つの知識転移モジュールを使用している。

  • SAM2CLIP: ディスティルと学習可能なトランスフォーマアダプタを介して、SAM のセグメンテーション知識を CLIP に適応する。
  • CLIP2SAM: CLIP の認識能力を SAM に転送し、物体を識別する能力を強化する。

対象ユーザー

インタラクティブな画像セグメンテーションおよびオープンボリューム物体認識に取り組むコンピュータビジョンの研究者および開発者。

特徴

  • オープンボリューム認識: 千クラス以上の物体をインタラクティブに認識・セグメンテーション可能。
  • 知識転移: セグメンテーションモデルと認識モデルのギャップを埋めるための二重モジュールアプローチを採用。
  • Condaベースのインストール: PyTorch および OpenMMLab パッケージの詳細なセットアップガイドを提供。
  • RWKV-SAM統合: 標準的な SAM アーキテクチャの高効率代替を探索する関連プロジェクトを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト