kyegomez/VisionMamba

Implementation of Vision Mamba from the paper: "Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model" It's 2.8x faster than DeiT and saves 86.8% GPU memory when performing batch inference to extract features on high-res images

해결하는 문제

전통적인 Vision Transformer(ViT)에 대한 효율적인 대안을 제공합니다. 고해상도 이미지를 처리할 때 표준 어텐션 메커니즘으로 인한 높은 계산 비용과 메모리 사용량 문제를 해결합니다.

작동 방식

이 프로젝트는 시각 데이터를 처리하기 위해 양방향 상태 공간 모델(SSM)을 구현합니다. 표준 트랜스포머와 달리, 이 아키텍처는 더 효율적인 특징 추출을 가능하게 하여 GPU 메모리 사용량을 크게 줄이고 추론 속도를 높입니다.

대상 사용자

제한된 GPU 메모리 또는 더 높은 추론 속도가 필요한 고해상도 이미지 처리가 필요한 컴퓨터 비전 작업을 수행하는 연구자 및 개발자입니다.

주요 특징

  • 배치 추론 시 DeiT보다 2.8배 빠릅니다.
  • 고해상도 이미지에서 특징을 추출할 때 GPU 메모리 사용량을 86.8% 감소시킵니다.
  • pip를 통해 간편하게 설치할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch
  • 프로젝트