HarborYuan/ovsam
[ECCV 2024] The official code of paper "Open-Vocabulary SAM".
何を解決するか
Open-Vocabulary SAM (OVSAM) は、Segment Anything Model (SAM) の制限を克服し、数千のクラスにわたるオープンボリューム設定で、物体のセグメンテーションだけでなく認識も可能にする。同時にインタラクティブなセグメンテーションと認識が可能である。
仕組み
OVSAM は、SAM と CLIP の強みを組み合わせるために、2つの知識転移モジュールを使用している。
- SAM2CLIP: ディスティルと学習可能なトランスフォーマアダプタを介して、SAM のセグメンテーション知識を CLIP に適応する。
- CLIP2SAM: CLIP の認識能力を SAM に転送し、物体を識別する能力を強化する。
対象ユーザー
インタラクティブな画像セグメンテーションおよびオープンボリューム物体認識に取り組むコンピュータビジョンの研究者および開発者。
特徴
- オープンボリューム認識: 千クラス以上の物体をインタラクティブに認識・セグメンテーション可能。
- 知識転移: セグメンテーションモデルと認識モデルのギャップを埋めるための二重モジュールアプローチを採用。
- Condaベースのインストール: PyTorch および OpenMMLab パッケージの詳細なセットアップガイドを提供。
- RWKV-SAM統合: 標準的な SAM アーキテクチャの高効率代替を探索する関連プロジェクトを含む。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト