BGU-CS-VIL/WTConv

Wavelet Convolutions for Large Receptive Fields. ECCV 2024.

해결하는 문제

매우 큰 커널과 관련된 일반적인 계산 오버헤드 없이 합성곱 신경망(CNN)에서 큰 수용 필드를 달성하는 문제를 해결합니다.

작동 방식

WTConv는 웨이블릿 변환을 사용하여 네트워크의 시야를 확장하는 웨이블릿 합성곱을 구현합니다. 기존 CNN 아키텍처에 통합할 수 있는 2D 및 1D 구현(WTConv2dWTConv1d)을 제공합니다. 성능을 향상시키기 위해 CUDA, Metal(MPS), Triton 백엔드용으로 최적화된 고성능 구현인 fast_wtconv를 포함하고 있습니다.

대상 사용자

컴퓨터 비전 및 신호 처리 작업 중인 연구자 및 개발자로, 효율성을 유지하면서 모델의 수용 필드를 개선하고자 하는 분들입니다.

주요 특징

  • 큰 수용 필드: 합성곱 연산이 "보는" 이미지 영역을 특별히 확대하도록 설계되었습니다.
  • 최적화된 백엔드: CUDA, Metal, Triton에서 고성능 실행을 위한 fast_wtconv 포함.
  • 사전 학습된 모델: ImageNet-1K에서 학습된 WTConvNeXt 모델(Tiny, Small, Base) 제공.
  • 유연한 통합: timm 모델 레지스트리와 호환되어 간편한 배포 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트