HarborYuan/ovsam

[ECCV 2024] The official code of paper "Open-Vocabulary SAM".

해결하는 문제

Open-Vocabulary SAM (OVSAM)는 Segment Anything Model (SAM)의 한계를 해결하여, 수천 개의 클래스에 걸쳐 개방형 어휘 설정에서 객체를 분할하고 인식할 수 있도록 합니다. 동시에 상호작용형 분할과 인식을 수행할 수 있습니다.

작동 방식

OVSAM는 SAM과 CLIP의 강점을 결합하기 위해 두 가지 지식 전이 모듈을 사용합니다:

  • SAM2CLIP: 정규화 및 학습 가능한 트랜스포머 어댑터를 통해 SAM의 분할 지식을 CLIP에 적응시킵니다.
  • CLIP2SAM: CLIP의 인식 능력을 SAM으로 전이하여 객체 식별 능력을 향상시킵니다.

대상 사용자

상호작용형 이미지 분할 및 개방형 어휘 객체 인식에 종사하는 컴퓨터 비전 연구자 및 개발자입니다.

주요 특징

  • 개방형 어휘 인식: 수천 개의 클래스를 상호작용적으로 인식하고 분할할 수 있습니다.
  • 지식 전이: 분할 모델과 인식 모델 간의 격차를 메우기 위해 이중 모듈 방식을 사용합니다.
  • Conda 기반 설치: PyTorch 및 OpenMMLab 패키지에 대한 자세한 설정 가이드를 제공합니다.
  • RWKV-SAM 통합: 표준 SAM 아키텍처의 고효율 대안을 탐색하는 관련 프로젝트를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트