HarborYuan/ovsam

[ECCV 2024] The official code of paper "Open-Vocabulary SAM".

What it solves

Open-Vocabulary SAM (OVSAM) 解決了 Segment Anything Model (SAM) 的限制,使其不僅能進行物體分割,還能在開放式詞彙設定下識別數千種類別的物體。它允許同時進行互動式分割與識別。

How it works

OVSAM 使用兩個知識轉移模組來結合 SAM 和 CLIP 的優點:

  • SAM2CLIP: 通過蒸餾和可學習的 transformer adapter,將 SAM 的分割知識轉移到 CLIP 中。
  • CLIP2SAM: 將 CLIP 的識別能力轉移到 SAM,以增強其識別物體的能力。

Who it’s for

從事互動式影像分割與開放式詞彙物體識別的研究人員與開發者。

Highlights

  • Open-Vocabulary Recognition: 能夠互動式地識別與分割兩萬種類別。
  • Knowledge Transfer: 使用雙模組方法來彌補分割模型與識別模型之間的差距。
  • Conda-based Installation: 為 PyTorch 和 OpenMMLab 套件提供詳細的安裝指南。
  • RWKV-SAM Integration: 包含一個相關專案,探索標準 SAM 架構的更高效能替代方案。

相關

  • 專案
  • 專案
  • 專案
  • 專案