kyegomez/VisionMamba

Implementation of Vision Mamba from the paper: "Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model" It's 2.8x faster than DeiT and saves 86.8% GPU memory when performing batch inference to extract features on high-res images

解決的問題

為視覺表示學習提供了一種傳統視覺Transformer(ViT)的高效替代方案。解決了在處理高解析度影像時,標準注意力機制所帶來的高計算成本與高記憶體使用問題。

工作原理

本專案實作了雙向狀態空間模型(SSM)來處理視覺資料。與標準Transformer不同,此架構允許更高效的特徵提取,顯著降低GPU記憶體佔用並提升推論速度。

適用對象

需要在有限GPU記憶體下處理高解析度影像,或對更高推論速度有需求的電腦視覺任務的研究人員與開發者。

主要亮點

  • 批次推論時比DeiT快2.8倍。
  • 從高解析度影像中提取特徵時,GPU記憶體使用量減少86.8%。
  • 支援透過pip輕鬆安裝。

相關

  • 專案
  • 專案
  • Dispatch
  • Dispatch
  • 專案