VCIP-RGBD/DFormer

DFormers for Multimodal Semantic Segmentation

DFormer – RGB‑Dセマンティックセグメンテーションツールキット

何が何なのか

  • ICLR 2024、CVPR 2025、IEEE TPAMI 2026で発表された論文に記載された、RGB‑D画像(カラー+深度)のセマンティックセグメンテーション用のモデル群(DFormer、DFormerv2、DFormer++)を実装した研究用コードベース。
  • リポジトリには、RGB‑D事前学習、データセット準備、学習、評価、推論用のツールも含まれています。

主な機能

機能 詳細
統合されたRGB‑Dエンコーダ 色と深度を別々のストリームではなく、統合的に処理する。
ジオメトリーガイド付きアテンション(DFormerv2) 深度からジオメトリープライアを生成し、アテンション機構に注入することで、3Dシーン理解を向上。
効率性重視のバリエーション(DFormer++) Tiny/Small/Baseモデル。NYU‑Depth v2で最大59% mIoUを達成しつつ、MACsとパラメータ数を低く抑える。
RGB‑D ImageNetでの事前学習 大規模RGB‑Dデータセットでエンコーダを事前学習し、下流のセグメンテーションベンチマーク(NYU‑Depth v2、SUN‑RGBDなど)で微調整するスクリプト。
ベンチマークユーティリティ FLOPs/パラメータ数のカウント、レイテンシ測定、一般的なデータセット用の準備済み設定ファイル。
可視化&デモ 簡単な推論スクリプトと、Hugging Face Spaceデモ(ジオメトリーアテンションマップを表示)。

導入方法

  1. 環境の作成(Python 3.10、PyTorch 2.1、CUDA 11.8)と必要なパッケージのインストール:
    conda create -n dformer python=3.10 -y
    conda activate dformer
    conda install pytorch==2.1.2 torchvision==0.16.2 torchaudio==2.1.2 pytorch-cuda=11.8 -c pytorch -c nvidia
    pip install mmcv==2.1.0 -f https://download.openmmlab.com/mmcv/dist/cu118/torch2.1/index.html
    pip install tqdm opencv-python scipy tensorboardX tabulate easydict ftfy regex timm
    # オプション:より高速なローカルアテンション用にTransNeXt swattention CUDA拡張をインストール
    
  2. データとチェックポイントのダウンロード – READMEにNYU‑Depth v2、SUN‑RGBD、事前学習済み重み用のGoogle Drive、OneDrive、BaiduNetdiskリンクが記載。datasets/checkpoints/ フォルダに、示されたフォルダ構造に従って配置。
  3. 学習 – 設定ファイル(例:local_configs.NYUDepthv2.DFormerPP_B)を選択し、実行:
    bash train.sh local_configs.NYUDepthv2.DFormerPP_B
    
    チェックポイントは checkpoints/<model>/ に保存されます。
  4. 評価 – 学習後、実行:
    bash eval.sh
    
  5. 推論/可視化 – セグメンテーションマップを生成:
    bash infer.sh
    
  6. 効率性の測定 – FLOPs/パラメータ数:
    PYTHONPATH="$(dirname $0)/..":$PYTHONPATH python benchmark.py --config local_configs.NYUDepthv2.DFormer_Large
    
    レイテンシ(デバイス固有):
    python utils/latency.py --config local_configs.NYUDepthv2.DFormer_Large
    

性能スナップショット(NYU‑Depth v2 mIoU)

モデル パラメータ数 MACs mIoU
DFormer++‑T 17.3 M 29.5 G 57.0
DFormer++‑S 37.2 M 56.4 G ~58.1
DFormer++‑B 66.7 M 97.5 G 59.0

関連プロジェクト

  • DFormer‑SOD – RGB‑D顕著オブジェクト検出(別リポジトリ)。
  • DFormer‑Jittor – Jittor深層学習フレームワークを使った実装(PyTorchの中国発の代替)。
  • RGB‑D ImageNet事前学習 – 大規模RGB‑D事前学習エンコーダの構築用コード。

引用 コードを使用する場合、READMEに記載された3つの論文(ICLR 2024、CVPR 2025、TPAMI 2026)を引用してください。

ライセンス

  • 非営利利用のみ(LICENSEセクションに記載)。

この要約は、リポジトリのREADMEに記載された情報に基づいています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト