VCIP-RGBD/DFormer
DFormers for Multimodal Semantic Segmentation
DFormer – RGB‑D 语义分割工具包
是什么
- 一个研究级代码库,实现了 DFormer、DFormerv2(几何引导注意力)和 DFormer++(高效高精度变体)等模型家族,用于 RGB‑D 图像(彩色 + 深度)的语义分割。这些模型发表于 ICLR 2024、CVPR 2025 和 IEEE TPAMI 2026。
- 该仓库还包含用于 RGB‑D 预训练、数据集准备、训练、评估和推理的工具。
核心功能
| 特性 | 详情 |
|---|---|
| 统一的 RGB‑D 编码器 | 联合处理颜色和深度,而非使用独立流。 |
| 几何引导注意力(DFormerv2) | 从深度生成几何先验,并注入注意力机制,提升 3D 场景理解能力。 |
| 面向效率的变体(DFormer++) | Tiny/Small/Base 模型,在 NYU‑Depth v2 上实现高达 59% mIoU 的准确率,同时保持低 MACs 和参数量。 |
| 在 RGB‑D ImageNet 上预训练 | 提供在大规模 RGB‑D 数据集上预训练编码器的脚本,然后在下游分割基准(NYU‑Depth v2、SUN‑RGBD 等)上微调。 |
| 基准测试工具 | 支持 FLOPs/参数计数、延迟测量,以及常见数据集的预设配置文件。 |
| 可视化与演示 | 提供简单推理脚本和 Hugging Face Space 演示,展示几何注意力图。 |
如何开始
- 创建环境(Python 3.10,PyTorch 2.1,CUDA 11.8)并安装所需包:
conda create -n dformer python=3.10 -y conda activate dformer conda install pytorch==2.1.2 torchvision==0.16.2 torchaudio==2.1.2 pytorch-cuda=11.8 -c pytorch -c nvidia pip install mmcv==2.1.0 -f https://download.openmmlab.com/mmcv/dist/cu118/torch2.1/index.html pip install tqdm opencv-python scipy tensorboardX tabulate easydict ftfy regex timm # 可选:安装 TransNeXt swattention CUDA 扩展以获得更快的局部注意力 - 下载数据和检查点 – README 中列出了 NYU‑Depth v2、SUN‑RGBD 和预训练权重的 Google Drive、OneDrive 和 BaiduNetdisk 链接。请按所示文件夹结构将它们放置在
datasets/和checkpoints/目录下。 - 训练 – 选择一个配置文件(例如
local_configs.NYUDepthv2.DFormerPP_B)并运行:
检查点将保存在bash train.sh local_configs.NYUDepthv2.DFormerPP_Bcheckpoints/<model>/目录下。 - 评估 – 训练完成后运行:
bash eval.sh - 推理 / 可视化 – 生成分割图:
bash infer.sh - 测量效率 – FLOPs/参数量:
延迟(设备特定):PYTHONPATH="$(dirname $0)/..":$PYTHONPATH python benchmark.py --config local_configs.NYUDepthv2.DFormer_Largepython utils/latency.py --config local_configs.NYUDepthv2.DFormer_Large
性能快照(NYU‑Depth v2 mIoU)
| 模型 | 参数量 | MACs | mIoU |
|---|---|---|---|
| DFormer++‑T | 17.3 M | 29.5 G | 57.0 |
| DFormer++‑S | 37.2 M | 56.4 G | ~58.1 |
| DFormer++‑B | 66.7 M | 97.5 G | 59.0 |
相关项目
- DFormer‑SOD – RGB‑D 显著对象检测(独立仓库)。
- DFormer‑Jittor – 使用 Jittor 深度学习框架实现(PyTorch 的中国起源替代方案)。
- RGB‑D ImageNet 预训练 – 构建大规模 RGB‑D 预训练编码器的代码。
引用 如果使用该代码,请引用 README 中列出的三篇论文(ICLR 2024、CVPR 2025、TPAMI 2026)。
许可证
- 仅限非商业用途(如 LICENSE 部分所述)。
本摘要仅基于仓库 README 中提供的信息。
相关
- 项目
- 项目
- 项目
- 项目