VisualComputingInstitute/diffusion-e2e-ft

[WACV'25 Oral] Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think

What it solves

此專案解決了用於深度與表面法線估計的機率擴散估計器效率低下、推論速度緩慢的問題。標準的擴散模型需要多次迭代才能產生結果,而本專案提供了一種將這些模型微調為單步決定性估計器的方法,使其更快且更精確。

How it works

研究人員開發了一種端對端(E2E)微調方法,用於影像條件擴散模型。透過套用任務特定的損失函數,他們可以將模型——無論是從預訓練的擴散估計器(如 Marigold、GeoWizard)開始,或是直接從 Stable Diffusion 開始——轉換為決定性模型。這些微調後的模型能在單次推論步驟中使用零噪聲產生深度圖或表面法線,顯著縮短預測時間且不犧牲品質。

Who it’s for

主要面向從事 2D 影像到 3D 場景理解、深度估計與表面法線預測的電腦視覺研究者與開發者。

Highlights

  • Single-Step Inference:將緩慢、多步的擴散過程轉換為快速、決定性的單步預測。
  • High Performance:在多個基準(NYUv2、KITTI、ScanNet 等)上,在速度與精度上皆優於原始擴散估計器。
  • Broad Compatibility:支援從多種起點微調,包括 Stable Diffusion、Marigold 與 GeoWizard。
  • Multi-Modality:能同時估計深度與表面法線。