kyegomez/VisionMamba
Implementation of Vision Mamba from the paper: "Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model" It's 2.8x faster than DeiT and saves 86.8% GPU memory when performing batch inference to extract features on high-res images
何を解決するか
従来のVision Transformer (ViT)の代替手段として、視覚的表現学習における効率性を提供します。高解像度画像を処理する際の標準的なアテンション機構に伴う高い計算コストとメモリ使用量という課題に対処します。
動作方法
このプロジェクトは、視覚データを処理するための双方向状態空間モデル (SSM) を実装しています。標準的なTransformerとは異なり、このアーキテクチャはより効率的な特徴抽出を可能にし、GPUメモリ使用量を大幅に削減し、推論速度を向上させます。
対象ユーザー
限られたGPUメモリで高解像度画像処理が必要なコンピュータビジョンタスクに取り組んでいる研究者や開発者です。
特徴
- バッチ推論時、DeiTよりも2.8倍高速。
- 高解像度画像からの特徴抽出時、GPUメモリ使用量を86.8%削減。
- pipによる簡単なインストール。
関連
- プロジェクト
- プロジェクト
- Dispatch
- Dispatch
- プロジェクト