kyegomez/VisionMamba

Implementation of Vision Mamba from the paper: "Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model" It's 2.8x faster than DeiT and saves 86.8% GPU memory when performing batch inference to extract features on high-res images

解决的问题

为视觉表示学习提供了一种传统视觉Transformer(ViT)的高效替代方案。解决了在处理高分辨率图像时,标准注意力机制带来的高计算成本和高内存使用问题。

工作原理

该项目实现了双向状态空间模型(SSM)来处理视觉数据。与标准Transformer不同,该架构允许更高效的特征提取,显著降低GPU内存占用并提升推理速度。

适用人群

需要在有限GPU内存下处理高分辨率图像,或对更高推理速度有需求的计算机视觉任务的研究人员和开发者。

主要亮点

  • 批量推理时比DeiT快2.8倍。
  • 在从高分辨率图像中提取特征时,GPU内存使用量减少86.8%。
  • 支持通过pip轻松安装。

相关

  • 项目
  • 项目
  • Dispatch
  • Dispatch
  • 项目