VisualComputingInstitute/diffusion-e2e-ft

[WACV'25 Oral] Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think

What it solves

该项目解决了用于深度和表面法线估计的概率扩散估计器效率低下、推理速度慢的问题。标准的扩散模型需要多次迭代才能得到结果,而本项目提供了一种将这些模型微调为单步确定性估计器的方法,使其更快且更准确。

How it works

研究人员开发了一种端到端(E2E)微调方法,用于图像条件扩散模型。通过应用任务特定的损失函数,他们可以将模型——无论是从预训练的扩散估计器(如 Marigold、GeoWizard)开始,还是直接从 Stable Diffusion 开始——转化为确定性模型。这些微调后的模型能够在单次推理步骤中使用零噪声生成深度图或表面法线,显著缩短预测时间且不牺牲质量。

Who it’s for

主要面向从事 2D 图像到 3D 场景理解、深度估计和表面法线预测的计算机视觉研究者和开发者。

Highlights

  • Single-Step Inference:将慢速、多步的扩散过程转化为快速、确定性的单步预测。
  • High Performance:在多个基准(NYUv2、KITTI、ScanNet 等)上,在速度和精度上均优于原始扩散估计器。
  • Broad Compatibility:支持从多种起点微调,包括 Stable Diffusion、Marigold 和 GeoWizard。
  • Multi-Modality:能够同时估计深度和表面法线。