VisualComputingInstitute/diffusion-e2e-ft

[WACV'25 Oral] Fine-Tuning Image-Conditional Diffusion Models is Easier than You Think

What it solves

このプロジェクトは、深度と表面法線推定に使用される確率的拡散推定器の非効率性と遅い推論速度に対処します。標準的な拡散モデルは結果を得るために複数の反復ステップが必要ですが、本プロジェクトはこれらのモデルを単一ステップの決定論的推定器にファインチューニングする手法を提供し、より高速かつ高精度にします。

How it works

研究者は画像条件付き拡散モデル向けのエンドツーエンド(E2E)ファインチューニング手法を開発しました。タスク固有のロスを適用することで、Marigold や GeoWizard といった事前学習済み拡散推定器、あるいは Stable Diffusion から直接、決定論的モデルへと変換できます。これらのファインチューニング済みモデルは、ゼロノイズで単一の推論ステップだけで深度マップや表面法線を生成し、品質を犠牲にすることなく予測に要する時間を大幅に短縮します。

Who it’s for

主に 2D 画像からの 3D シーン理解、深度推定、表面法線予測に取り組むコンピュータビジョン研究者や開発者向けです。

Highlights

  • Single-Step Inference: 遅いマルチステップ拡散プロセスを高速な決定論的単一ステップ予測に変換します。
  • High Performance: NYUv2、KITTI、ScanNet など複数のベンチマークで、速度と精度の両面で元の拡散推定器を上回ります。
  • Broad Compatibility: Stable Diffusion、Marigold、GeoWizard など、さまざまな出発点からのファインチューニングをサポートします。
  • Multi-Modality: 深度と表面法線の両方を推定可能です。