VCIP-RGBD/DFormer

DFormers for Multimodal Semantic Segmentation

DFormer – RGB‑D 세그멘테이션 툴킷

무엇인가요

  • ICLR 2024, CVPR 2025, IEEE TPAMI 2026에 게재된 논문에 기술된 RGB‑D 이미지(컬러 + 깊이)의 세그멘테이션을 위한 모델군(DFormer, DFormerv2, DFormer++)을 구현한 연구용 코드베이스입니다.
  • 리포지토리는 RGB‑D 사전 훈련, 데이터셋 준비, 훈련, 평가, 추론을 위한 도구도 포함하고 있습니다.

주요 기능

기능 세부 사항
통합 RGB‑D 인코더 별도의 스트림을 사용하는 대신 색상과 깊이를 함께 처리합니다.
지오메트리 가이드 애티튜드(DFormerv2) 깊이에서 지오메트리 사전 지식을 생성하여 애티튜드 메커니즘에 주입함으로써 3D 장면 이해를 향상시킵니다.
효율성 중심의 변형(DFormer++) 정확도(최대 59% mIoU, NYU‑Depth v2 기준)와 낮은 MACs 및 파라미터 수를 균형 있게 유지하는 Tiny/Small/Base 모델입니다.
RGB‑D ImageNet에서의 사전 훈련 대규모 RGB‑D 데이터셋에서 인코더를 사전 훈련한 후, 하류 세그멘테이션 벤치마크(NYU‑Depth v2, SUN‑RGBD 등)에서 미세 조정하는 스크립트를 제공합니다.
벤치마킹 유틸리티 FLOPs/파라미터 수 계산, 지연 시간 측정, 일반 데이터셋용 미리 준비된 설정 파일을 제공합니다.
시각화 및 데모 간단한 추론 스크립트와 Hugging Face Space 데모를 통해 지오메트리 애티튜드 맵을 확인할 수 있습니다.

시작하기

  1. 환경 생성(Python 3.10, PyTorch 2.1, CUDA 11.8) 및 필수 패키지 설치:
    conda create -n dformer python=3.10 -y
    conda activate dformer
    conda install pytorch==2.1.2 torchvision==0.16.2 torchaudio==2.1.2 pytorch-cuda=11.8 -c pytorch -c nvidia
    pip install mmcv==2.1.0 -f https://download.openmmlab.com/mmcv/dist/cu118/torch2.1/index.html
    pip install tqdm opencv-python scipy tensorboardX tabulate easydict ftfy regex timm
    # 선택 사항: 더 빠른 로컬 애티튜드를 위해 TransNeXt swattention CUDA 확장 설치
    
  2. 데이터 및 체크포인트 다운로드 – README에 NYU‑Depth v2, SUN‑RGBD, 사전 학습된 가중치용 Google Drive, OneDrive, BaiduNetdisk 링크가 나와 있습니다. datasets/checkpoints/ 폴더에 표시된 폴더 구조에 따라 위치시킵니다.
  3. 훈련 – 설정 파일을 선택(예: local_configs.NYUDepthv2.DFormerPP_B)하고 실행:
    bash train.sh local_configs.NYUDepthv2.DFormerPP_B
    
    체크포인트는 checkpoints/<model>/에 저장됩니다.
  4. 평가 – 훈련 후 실행:
    bash eval.sh
    
  5. 추론 / 시각화 – 세그멘테이션 맵 생성:
    bash infer.sh
    
  6. 효율성 측정 – FLOPs/파라미터 수:
    PYTHONPATH="$(dirname $0)/..":$PYTHONPATH python benchmark.py --config local_configs.NYUDepthv2.DFormer_Large
    
    지연 시간(장치별):
    python utils/latency.py --config local_configs.NYUDepthv2.DFormer_Large
    

성능 스냅샷(NYU‑Depth v2 mIoU)

모델 파라미터 수 MACs mIoU
DFormer++‑T 17.3 M 29.5 G 57.0
DFormer++‑S 37.2 M 56.4 G ~58.1
DFormer++‑B 66.7 M 97.5 G 59.0

관련 프로젝트

  • DFormer‑SOD – RGB‑D 주목할 만한 객체 탐지 (별도 리포지토리).
  • DFormer‑Jittor – Jittor 딥러닝 프레임워크를 사용한 구현 (PyTorch의 중국 출신 대안).
  • RGB‑D ImageNet 사전 훈련 – 대규모 RGB‑D 사전 훈련 인코더 구축용 코드.

인용 코드를 사용할 경우, README에 나와 있는 세 개의 논문(ICLR 2024, CVPR 2025, TPAMI 2026)을 인용해 주세요.

라이선스

  • 비영리 목적에 한함 (LICENSE 섹션 참조).

이 요약은 리포지토리의 README에 제공된 정보에 기반합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트