VCIP-RGBD/DFormer

DFormers for Multimodal Semantic Segmentation

DFormer – RGB‑D 語意分割工具包

是什麼

  • 一個研究級程式碼庫,實作 DFormer、DFormerv2(幾何引導注意力)與 DFormer++(高效高準確度變體)等模型家族,用於 RGB‑D 圖像(彩色 + 深度)的語意分割。這些模型發表於 ICLR 2024、CVPR 2025 與 IEEE TPAMI 2026。
  • 此倉儲也包含用於 RGB‑D 預訓練、資料集準備、訓練、評估與推論的工具。

核心功能

特性 詳細
統一的 RGB‑D 編碼器 聯合處理顏色與深度,而非使用獨立串流。
幾何引導注意力(DFormerv2) 從深度生成幾何先驗,並注入注意力機制,提升 3D 場景理解能力。
面向效率的變體(DFormer++) Tiny/Small/Base 模型,在 NYU‑Depth v2 上達成高達 59% mIoU 的準確率,同時保持低 MACs 與參數數量。
在 RGB‑D ImageNet 上預訓練 提供在大型 RGB‑D 資料集上預訓練編碼器的腳本,再於下游分割基準(NYU‑Depth v2、SUN‑RGBD 等)上微調。
基準測試工具 支援 FLOPs/參數計數、延遲測量,以及常見資料集的預設設定檔。
可視化與示範 提供簡單推論腳本與 Hugging Face Space 示範,展示幾何注意力圖。

如何開始

  1. 建立環境(Python 3.10,PyTorch 2.1,CUDA 11.8)並安裝所需套件:
    conda create -n dformer python=3.10 -y
    conda activate dformer
    conda install pytorch==2.1.2 torchvision==0.16.2 torchaudio==2.1.2 pytorch-cuda=11.8 -c pytorch -c nvidia
    pip install mmcv==2.1.0 -f https://download.openmmlab.com/mmcv/dist/cu118/torch2.1/index.html
    pip install tqdm opencv-python scipy tensorboardX tabulate easydict ftfy regex timm
    # 可選:安裝 TransNeXt swattention CUDA 擴充以獲得更快的局部注意力
    
  2. 下載資料與檢查點 – README 中列出 NYU‑Depth v2、SUN‑RGBD 與預訓練權重的 Google Drive、OneDrive 與 BaiduNetdisk 連結。請依照所示資料夾結構,將其放置於 datasets/checkpoints/ 目錄下。
  3. 訓練 – 選擇一個設定檔(例如 local_configs.NYUDepthv2.DFormerPP_B)並執行:
    bash train.sh local_configs.NYUDepthv2.DFormerPP_B
    
    檢查點將儲存在 checkpoints/<model>/ 目錄中。
  4. 評估 – 訓練完成後執行:
    bash eval.sh
    
  5. 推論 / 可視化 – 產生分割圖:
    bash infer.sh
    
  6. 測量效率 – FLOPs/參數數量:
    PYTHONPATH="$(dirname $0)/..":$PYTHONPATH python benchmark.py --config local_configs.NYUDepthv2.DFormer_Large
    
    延遲(設備特定):
    python utils/latency.py --config local_configs.NYUDepthv2.DFormer_Large
    

效能快照(NYU‑Depth v2 mIoU)

模型 參數數量 MACs mIoU
DFormer++‑T 17.3 M 29.5 G 57.0
DFormer++‑S 37.2 M 56.4 G ~58.1
DFormer++‑B 66.7 M 97.5 G 59.0

相關專案

  • DFormer‑SOD – RGB‑D 顯著物件檢測(獨立倉儲)。
  • DFormer‑Jittor – 使用 Jittor 深度學習框架實作(PyTorch 的中國起源替代方案)。
  • RGB‑D ImageNet 預訓練 – 建構大型 RGB‑D 預訓練編碼器的程式碼。

引用 若使用此程式碼,請引用 README 中列出的三篇論文(ICLR 2024、CVPR 2025、TPAMI 2026)。

授權

  • 僅限非商業用途(如 LICENSE 章節所述)。

本摘要僅基於倉儲 README 提供的資訊。

相關

  • 專案
  • 專案
  • 專案
  • 專案