kyegomez/VisionMamba
Implementation of Vision Mamba from the paper: "Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model" It's 2.8x faster than DeiT and saves 86.8% GPU memory when performing batch inference to extract features on high-res images
해결하는 문제
전통적인 Vision Transformer(ViT)에 대한 효율적인 대안을 제공합니다. 고해상도 이미지를 처리할 때 표준 어텐션 메커니즘으로 인한 높은 계산 비용과 메모리 사용량 문제를 해결합니다.
작동 방식
이 프로젝트는 시각 데이터를 처리하기 위해 양방향 상태 공간 모델(SSM)을 구현합니다. 표준 트랜스포머와 달리, 이 아키텍처는 더 효율적인 특징 추출을 가능하게 하여 GPU 메모리 사용량을 크게 줄이고 추론 속도를 높입니다.
대상 사용자
제한된 GPU 메모리 또는 더 높은 추론 속도가 필요한 고해상도 이미지 처리가 필요한 컴퓨터 비전 작업을 수행하는 연구자 및 개발자입니다.
주요 특징
- 배치 추론 시 DeiT보다 2.8배 빠릅니다.
- 고해상도 이미지에서 특징을 추출할 때 GPU 메모리 사용량을 86.8% 감소시킵니다.
- pip를 통해 간편하게 설치할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- Dispatch
- 프로젝트