zju3dv/MatchAnything

Code for "MatchAnything: Universal Cross-Modality Image Matching with Large-Scale Pre-Training", TPAMI 2026.

MatchAnything – 유니버설 크로스모달 이미지 매칭

무엇을 하는가

  • 서로 다른 시각 모달리티(예: RGB 사진, 적외선, 스케치, 깊이 맵 등)에서 온 이미지 간의 대응 관계를 찾을 수 있는 단일 모델을 학습합니다.
  • 매우 크고 다양한 데이터셋에서 사전 훈련되어 있어, 작업에 특화된 미세 조정 없이도 "어떤 이미지도 매칭"할 수 있습니다.

왜 중요한가

  • 전통적인 이미지 매칭 파이프라인(SIFT, SuperPoint 등)은 두 이미지가 동일한 시각 도메인에 속할 때만 잘 작동합니다. 로봇공학, 원격 탐사, 의료 영상, AR에서는 센서가 비슷하지 않은 데이터를 생성하므로 크로스모달 매칭이 필요합니다.
  • 유니버설 매처는 각 모달리티 쌍에 대해 별도의 파이프라인을 구축하는 엔지니어링 노력이 줄어듭니다.

핵심 구성 요소 (README에 설명됨)

  1. 대규모 사전 훈련 – 다양한 모달리티의 대량 이미지 쌍을 사용해 네트워크를 훈련하여 모달리티에 관계없이 추출 가능한 특징을 학습합니다.
  2. 유니버설 매처 아키텍처 – README에는 네트워크 구체적 설명이 없지만, 이름에서 유추되는 바와 같이 어떤 모달리티 쌍에도 사용 가능한 밀집 기술자(디스크립터)를 출력하는 단일 백본을 가집니다.
  3. 사전 훈련된 가중치 – Hugging Face에 호스팅되어 있어 즉시 추론이 가능합니다.
  4. 데모 – 인터랙티브한 Hugging Face Space를 통해 서로 다른 유형의 두 이미지를 업로드하고 매칭 결과를 즉시 확인할 수 있습니다.

시작 방법

  1. README에 링크된 Hugging Face 데모에 접속하여 아무런 설치 없이 모델을 시도해 보세요.
  2. 리포지토리 복제 후, 공개 예정인 (미래의) 훈련 지침을 따르세요.
  3. 제공된 사전 훈련된 가중치(사용 가능한 third_party/MatchAnything 폴더 내)를 사용해 자신의 이미지 쌍에 대해 추론을 실행하세요.

대상 사용자

  • 크로스모달 대응을 필요로 하는 연구자 및 엔지니어.
  • 여러 센서에서 데이터를 융합하는 로봇, 드론, AR 장치의 인식 스택을 개발하는 개발자.

논문 및 인용

  • 이 방법은 논문 MatchAnything: Large-Scale Pre-Training을 활용한 유니버설 크로스모달 이미지 매칭 (TPAMI 2026)에 설명되어 있습니다. README에는 인용을 위한 BibTeX 항목이 제공됩니다.

현재 상태

  • 사전 훈련된 모델이 공개되어 있습니다.
  • 훈련 코드는 향후 릴리스 예정입니다.

위 정보는 리포지토리의 README에서 직접 가져온 것이며, 추가 기능은 추정되지 않았습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch