VCIP-RGBD/DFormer
DFormers for Multimodal Semantic Segmentation
DFormer – RGB‑Dセマンティックセグメンテーションツールキット
何が何なのか
- ICLR 2024、CVPR 2025、IEEE TPAMI 2026で発表された論文に記載された、RGB‑D画像(カラー+深度)のセマンティックセグメンテーション用のモデル群(DFormer、DFormerv2、DFormer++)を実装した研究用コードベース。
- リポジトリには、RGB‑D事前学習、データセット準備、学習、評価、推論用のツールも含まれています。
主な機能
| 機能 | 詳細 |
|---|---|
| 統合されたRGB‑Dエンコーダ | 色と深度を別々のストリームではなく、統合的に処理する。 |
| ジオメトリーガイド付きアテンション(DFormerv2) | 深度からジオメトリープライアを生成し、アテンション機構に注入することで、3Dシーン理解を向上。 |
| 効率性重視のバリエーション(DFormer++) | Tiny/Small/Baseモデル。NYU‑Depth v2で最大59% mIoUを達成しつつ、MACsとパラメータ数を低く抑える。 |
| RGB‑D ImageNetでの事前学習 | 大規模RGB‑Dデータセットでエンコーダを事前学習し、下流のセグメンテーションベンチマーク(NYU‑Depth v2、SUN‑RGBDなど)で微調整するスクリプト。 |
| ベンチマークユーティリティ | FLOPs/パラメータ数のカウント、レイテンシ測定、一般的なデータセット用の準備済み設定ファイル。 |
| 可視化&デモ | 簡単な推論スクリプトと、Hugging Face Spaceデモ(ジオメトリーアテンションマップを表示)。 |
導入方法
- 環境の作成(Python 3.10、PyTorch 2.1、CUDA 11.8)と必要なパッケージのインストール:
conda create -n dformer python=3.10 -y conda activate dformer conda install pytorch==2.1.2 torchvision==0.16.2 torchaudio==2.1.2 pytorch-cuda=11.8 -c pytorch -c nvidia pip install mmcv==2.1.0 -f https://download.openmmlab.com/mmcv/dist/cu118/torch2.1/index.html pip install tqdm opencv-python scipy tensorboardX tabulate easydict ftfy regex timm # オプション:より高速なローカルアテンション用にTransNeXt swattention CUDA拡張をインストール - データとチェックポイントのダウンロード – READMEにNYU‑Depth v2、SUN‑RGBD、事前学習済み重み用のGoogle Drive、OneDrive、BaiduNetdiskリンクが記載。
datasets/とcheckpoints/フォルダに、示されたフォルダ構造に従って配置。 - 学習 – 設定ファイル(例:
local_configs.NYUDepthv2.DFormerPP_B)を選択し、実行:
チェックポイントはbash train.sh local_configs.NYUDepthv2.DFormerPP_Bcheckpoints/<model>/に保存されます。 - 評価 – 学習後、実行:
bash eval.sh - 推論/可視化 – セグメンテーションマップを生成:
bash infer.sh - 効率性の測定 – FLOPs/パラメータ数:
レイテンシ(デバイス固有):PYTHONPATH="$(dirname $0)/..":$PYTHONPATH python benchmark.py --config local_configs.NYUDepthv2.DFormer_Largepython utils/latency.py --config local_configs.NYUDepthv2.DFormer_Large
性能スナップショット(NYU‑Depth v2 mIoU)
| モデル | パラメータ数 | MACs | mIoU |
|---|---|---|---|
| DFormer++‑T | 17.3 M | 29.5 G | 57.0 |
| DFormer++‑S | 37.2 M | 56.4 G | ~58.1 |
| DFormer++‑B | 66.7 M | 97.5 G | 59.0 |
関連プロジェクト
- DFormer‑SOD – RGB‑D顕著オブジェクト検出(別リポジトリ)。
- DFormer‑Jittor – Jittor深層学習フレームワークを使った実装(PyTorchの中国発の代替)。
- RGB‑D ImageNet事前学習 – 大規模RGB‑D事前学習エンコーダの構築用コード。
引用 コードを使用する場合、READMEに記載された3つの論文(ICLR 2024、CVPR 2025、TPAMI 2026)を引用してください。
ライセンス
- 非営利利用のみ(LICENSEセクションに記載)。
この要約は、リポジトリのREADMEに記載された情報に基づいています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト