tue-mps/eomt

[CVPR 2025 Highlight] Official code and models for Encoder-only Mask Transformer (EoMT).

해결하는 문제

EoMT는 복잡한 태스크 전용 디코더나 어댑터의 필요성을 제거함으로써 이미지 세그멘테이션을 단순화합니다. 일반적인 Vision Transformer (ViT)가 최첨단 방법에서 일반적으로 요구되는 아키텍처적 부담 없이 고품질 세그멘테이션을 수행할 수 있음을 보여줍니다.

작동 방식

엔코더 전용 마스크 트랜스포머(EoMT)는 사전 훈련된 ViT를 재사용하여 이미지 패치와 세그멘테이션 쿼리를 동일한 토큰으로 통합적으로 인코딩합니다. 두 요소를 동일한 트랜스포머 아키텍처 내에서 토큰으로 취급함으로써 별도의 디코더가 필요 없게 되어, 엔코더에서 직접 세그멘테이션 마스크를 출력할 수 있습니다.

대상 사용자

패ノ픽, 인스턴스, 세멘틱 세그멘테이션 작업에 종사하는 컴퓨터 비전 연구자 및 개발자 중, 높은 정확도를 유지하면서도 더 빠르고 간소한 아키텍처를 원하는 사람들을 위한 것입니다.

주요 특징

  • 최소한의 아키텍처: 어댑터나 디코더 없이 일반적인 ViT만 사용.
  • 높은 성능: SOTA 방법과 유사한 정확도를 달성하면서도 최대 4배 빠름 (예: ViT-L).
  • 광범위한 호환성: DINOv2 및 DINOv3 백본과 호환.
  • 다용도성: COCO, ADE20K, Cityscapes 등 다양한 데이터셋에서 패노픽, 인스턴스, 세멘틱 세그멘테이션 작업 지원.
  • 통합성: Hugging Face Transformers를 통해 사용 가능.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트