VisualComputingInstitute/diffusion-e2e-ft
[WACV'25 Oral] Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think
What it solves
이 프로젝트는 깊이와 표면 법선 추정을 위해 사용되는 확률적 확산 추정기의 비효율성과 느린 추론 속도를 해결합니다. 표준 확산 모델은 결과를 얻기 위해 여러 반복 단계를 필요로 하지만, 이 프로젝트는 이러한 모델을 단일 단계 결정론적 추정기로 파인튜닝하는 방법을 제공하여 더 빠르고 정확하게 만듭니다.
How it works
연구자들은 이미지 조건부 확산 모델을 위한 엔드‑투‑엔드(E2E) 파인튜닝 접근 방식을 개발했습니다. 작업‑특화 손실을 적용함으로써 Marigold 및 GeoWizard와 같은 사전 학습된 확산 추정기나 Stable Diffusion에서 직접 시작하는 모델을 결정론적 모델로 변환할 수 있습니다. 이러한 파인튜닝된 모델은 제로 노이즈를 사용해 단일 추론 단계만으로 깊이 맵이나 표면 법선을 생성하며, 품질을 희생하지 않고 예측에 소요되는 시간을 크게 줄입니다.
Who it’s for
이 프로젝트는 주로 2D 이미지로부터 3D 씬 이해, 깊이 추정 및 표면 법선 예측을 수행하는 컴퓨터 비전 연구자와 개발자를 위한 것입니다.
Highlights
- Single-Step Inference: 느리고 다단계인 확산 과정을 빠르고 결정론적인 단일 단계 예측으로 변환합니다.
- High Performance: NYUv2, KITTI, ScanNet 등 여러 벤치마크에서 속도와 정확도 모두에서 기존 확산 추정기를 능가합니다.
- Broad Compatibility: Stable Diffusion, Marigold, GeoWizard 등 다양한 시작점에서 파인튜닝을 지원합니다.
- Multi-Modality: 깊이와 표면 법선을 모두 추정할 수 있습니다.