HarborYuan/ovsam

[ECCV 2024] The official code of paper "Open-Vocabulary SAM".

What it solves

Open-Vocabulary SAM (OVSAM) 解决了 Segment Anything Model (SAM) 的局限性,使其不仅能进行物体分割,还能在开放式词汇设置下识别数千种类别的物体。它允许同时进行交互式分割与识别。

How it works

OVSAM 使用两个知识转移模块来结合 SAM 和 CLIP 的优势:

  • SAM2CLIP: 通过蒸馏和可学习的 transformer adapter,将 SAM 的分割知识转移到 CLIP 中。

  • CLIP2SAM: 将 CLIP 的识别能力转移到 CLIP 的 SAM,以增强其识别物体的能力。

Who it’s for

从事交互式图像分割与开放式词汇物体识别的研究人员与开发者的。

Highlights

  • Open-Vocabulary Recognition: 能够交互式地识别与分割两万种类别。

  • nKnowledge Transfer: 使用双模块方法来弥补分割模型与识别模型之间的差距。

  • Conda-based Installation: 提供 PyTorch 和 OpenMMLab 软件包的详细安装指南。

  • **★★

  • RWKV-SAM Integration:

相关

  • 项目
  • 项目
  • 项目
  • 项目