HarborYuan/ovsam
[ECCV 2024] The official code of paper "Open-Vocabulary SAM".
What it solves
Open-Vocabulary SAM (OVSAM) 解決了 Segment Anything Model (SAM) 的限制,使其不僅能進行物體分割,還能在開放式詞彙設定下識別數千種類別的物體。它允許同時進行互動式分割與識別。
How it works
OVSAM 使用兩個知識轉移模組來結合 SAM 和 CLIP 的優點:
- SAM2CLIP: 通過蒸餾和可學習的 transformer adapter,將 SAM 的分割知識轉移到 CLIP 中。
- CLIP2SAM: 將 CLIP 的識別能力轉移到 SAM,以增強其識別物體的能力。
Who it’s for
從事互動式影像分割與開放式詞彙物體識別的研究人員與開發者。
Highlights
- Open-Vocabulary Recognition: 能夠互動式地識別與分割兩萬種類別。
- Knowledge Transfer: 使用雙模組方法來彌補分割模型與識別模型之間的差距。
- Conda-based Installation: 為 PyTorch 和 OpenMMLab 套件提供詳細的安裝指南。
- RWKV-SAM Integration: 包含一個相關專案,探索標準 SAM 架構的更高效能替代方案。
相關
- 專案
- 專案
- 專案
- 專案