kyegomez/VisionMamba
Implementation of Vision Mamba from the paper: "Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model" It's 2.8x faster than DeiT and saves 86.8% GPU memory when performing batch inference to extract features on high-res images
解決的問題
為視覺表示學習提供了一種傳統視覺Transformer(ViT)的高效替代方案。解決了在處理高解析度影像時,標準注意力機制所帶來的高計算成本與高記憶體使用問題。
工作原理
本專案實作了雙向狀態空間模型(SSM)來處理視覺資料。與標準Transformer不同,此架構允許更高效的特徵提取,顯著降低GPU記憶體佔用並提升推論速度。
適用對象
需要在有限GPU記憶體下處理高解析度影像,或對更高推論速度有需求的電腦視覺任務的研究人員與開發者。
主要亮點
- 批次推論時比DeiT快2.8倍。
- 從高解析度影像中提取特徵時,GPU記憶體使用量減少86.8%。
- 支援透過pip輕鬆安裝。
相關
- 專案
- 專案
- Dispatch
- Dispatch
- 專案