VCIP-RGBD/DFormer
DFormers for Multimodal Semantic Segmentation
DFormer – RGB‑D 語意分割工具包
是什麼
- 一個研究級程式碼庫,實作 DFormer、DFormerv2(幾何引導注意力)與 DFormer++(高效高準確度變體)等模型家族,用於 RGB‑D 圖像(彩色 + 深度)的語意分割。這些模型發表於 ICLR 2024、CVPR 2025 與 IEEE TPAMI 2026。
- 此倉儲也包含用於 RGB‑D 預訓練、資料集準備、訓練、評估與推論的工具。
核心功能
| 特性 | 詳細 |
|---|---|
| 統一的 RGB‑D 編碼器 | 聯合處理顏色與深度,而非使用獨立串流。 |
| 幾何引導注意力(DFormerv2) | 從深度生成幾何先驗,並注入注意力機制,提升 3D 場景理解能力。 |
| 面向效率的變體(DFormer++) | Tiny/Small/Base 模型,在 NYU‑Depth v2 上達成高達 59% mIoU 的準確率,同時保持低 MACs 與參數數量。 |
| 在 RGB‑D ImageNet 上預訓練 | 提供在大型 RGB‑D 資料集上預訓練編碼器的腳本,再於下游分割基準(NYU‑Depth v2、SUN‑RGBD 等)上微調。 |
| 基準測試工具 | 支援 FLOPs/參數計數、延遲測量,以及常見資料集的預設設定檔。 |
| 可視化與示範 | 提供簡單推論腳本與 Hugging Face Space 示範,展示幾何注意力圖。 |
如何開始
- 建立環境(Python 3.10,PyTorch 2.1,CUDA 11.8)並安裝所需套件:
conda create -n dformer python=3.10 -y conda activate dformer conda install pytorch==2.1.2 torchvision==0.16.2 torchaudio==2.1.2 pytorch-cuda=11.8 -c pytorch -c nvidia pip install mmcv==2.1.0 -f https://download.openmmlab.com/mmcv/dist/cu118/torch2.1/index.html pip install tqdm opencv-python scipy tensorboardX tabulate easydict ftfy regex timm # 可選:安裝 TransNeXt swattention CUDA 擴充以獲得更快的局部注意力 - 下載資料與檢查點 – README 中列出 NYU‑Depth v2、SUN‑RGBD 與預訓練權重的 Google Drive、OneDrive 與 BaiduNetdisk 連結。請依照所示資料夾結構,將其放置於
datasets/與checkpoints/目錄下。 - 訓練 – 選擇一個設定檔(例如
local_configs.NYUDepthv2.DFormerPP_B)並執行:
檢查點將儲存在bash train.sh local_configs.NYUDepthv2.DFormerPP_Bcheckpoints/<model>/目錄中。 - 評估 – 訓練完成後執行:
bash eval.sh - 推論 / 可視化 – 產生分割圖:
bash infer.sh - 測量效率 – FLOPs/參數數量:
延遲(設備特定):PYTHONPATH="$(dirname $0)/..":$PYTHONPATH python benchmark.py --config local_configs.NYUDepthv2.DFormer_Largepython utils/latency.py --config local_configs.NYUDepthv2.DFormer_Large
效能快照(NYU‑Depth v2 mIoU)
| 模型 | 參數數量 | MACs | mIoU |
|---|---|---|---|
| DFormer++‑T | 17.3 M | 29.5 G | 57.0 |
| DFormer++‑S | 37.2 M | 56.4 G | ~58.1 |
| DFormer++‑B | 66.7 M | 97.5 G | 59.0 |
相關專案
- DFormer‑SOD – RGB‑D 顯著物件檢測(獨立倉儲)。
- DFormer‑Jittor – 使用 Jittor 深度學習框架實作(PyTorch 的中國起源替代方案)。
- RGB‑D ImageNet 預訓練 – 建構大型 RGB‑D 預訓練編碼器的程式碼。
引用 若使用此程式碼,請引用 README 中列出的三篇論文(ICLR 2024、CVPR 2025、TPAMI 2026)。
授權
- 僅限非商業用途(如 LICENSE 章節所述)。
本摘要僅基於倉儲 README 提供的資訊。
相關
- 專案
- 專案
- 專案
- 專案