VCIP-RGBD/DFormer
DFormers for Multimodal Semantic Segmentation
DFormer – RGB‑D 세그멘테이션 툴킷
무엇인가요
- ICLR 2024, CVPR 2025, IEEE TPAMI 2026에 게재된 논문에 기술된 RGB‑D 이미지(컬러 + 깊이)의 세그멘테이션을 위한 모델군(DFormer, DFormerv2, DFormer++)을 구현한 연구용 코드베이스입니다.
- 리포지토리는 RGB‑D 사전 훈련, 데이터셋 준비, 훈련, 평가, 추론을 위한 도구도 포함하고 있습니다.
주요 기능
| 기능 | 세부 사항 |
|---|---|
| 통합 RGB‑D 인코더 | 별도의 스트림을 사용하는 대신 색상과 깊이를 함께 처리합니다. |
| 지오메트리 가이드 애티튜드(DFormerv2) | 깊이에서 지오메트리 사전 지식을 생성하여 애티튜드 메커니즘에 주입함으로써 3D 장면 이해를 향상시킵니다. |
| 효율성 중심의 변형(DFormer++) | 정확도(최대 59% mIoU, NYU‑Depth v2 기준)와 낮은 MACs 및 파라미터 수를 균형 있게 유지하는 Tiny/Small/Base 모델입니다. |
| RGB‑D ImageNet에서의 사전 훈련 | 대규모 RGB‑D 데이터셋에서 인코더를 사전 훈련한 후, 하류 세그멘테이션 벤치마크(NYU‑Depth v2, SUN‑RGBD 등)에서 미세 조정하는 스크립트를 제공합니다. |
| 벤치마킹 유틸리티 | FLOPs/파라미터 수 계산, 지연 시간 측정, 일반 데이터셋용 미리 준비된 설정 파일을 제공합니다. |
| 시각화 및 데모 | 간단한 추론 스크립트와 Hugging Face Space 데모를 통해 지오메트리 애티튜드 맵을 확인할 수 있습니다. |
시작하기
- 환경 생성(Python 3.10, PyTorch 2.1, CUDA 11.8) 및 필수 패키지 설치:
conda create -n dformer python=3.10 -y conda activate dformer conda install pytorch==2.1.2 torchvision==0.16.2 torchaudio==2.1.2 pytorch-cuda=11.8 -c pytorch -c nvidia pip install mmcv==2.1.0 -f https://download.openmmlab.com/mmcv/dist/cu118/torch2.1/index.html pip install tqdm opencv-python scipy tensorboardX tabulate easydict ftfy regex timm # 선택 사항: 더 빠른 로컬 애티튜드를 위해 TransNeXt swattention CUDA 확장 설치 - 데이터 및 체크포인트 다운로드 – README에 NYU‑Depth v2, SUN‑RGBD, 사전 학습된 가중치용 Google Drive, OneDrive, BaiduNetdisk 링크가 나와 있습니다.
datasets/및checkpoints/폴더에 표시된 폴더 구조에 따라 위치시킵니다. - 훈련 – 설정 파일을 선택(예:
local_configs.NYUDepthv2.DFormerPP_B)하고 실행:
체크포인트는bash train.sh local_configs.NYUDepthv2.DFormerPP_Bcheckpoints/<model>/에 저장됩니다. - 평가 – 훈련 후 실행:
bash eval.sh - 추론 / 시각화 – 세그멘테이션 맵 생성:
bash infer.sh - 효율성 측정 – FLOPs/파라미터 수:
지연 시간(장치별):PYTHONPATH="$(dirname $0)/..":$PYTHONPATH python benchmark.py --config local_configs.NYUDepthv2.DFormer_Largepython utils/latency.py --config local_configs.NYUDepthv2.DFormer_Large
성능 스냅샷(NYU‑Depth v2 mIoU)
| 모델 | 파라미터 수 | MACs | mIoU |
|---|---|---|---|
| DFormer++‑T | 17.3 M | 29.5 G | 57.0 |
| DFormer++‑S | 37.2 M | 56.4 G | ~58.1 |
| DFormer++‑B | 66.7 M | 97.5 G | 59.0 |
관련 프로젝트
- DFormer‑SOD – RGB‑D 주목할 만한 객체 탐지 (별도 리포지토리).
- DFormer‑Jittor – Jittor 딥러닝 프레임워크를 사용한 구현 (PyTorch의 중국 출신 대안).
- RGB‑D ImageNet 사전 훈련 – 대규모 RGB‑D 사전 훈련 인코더 구축용 코드.
인용 코드를 사용할 경우, README에 나와 있는 세 개의 논문(ICLR 2024, CVPR 2025, TPAMI 2026)을 인용해 주세요.
라이선스
- 비영리 목적에 한함 (LICENSE 섹션 참조).
이 요약은 리포지토리의 README에 제공된 정보에 기반합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트