nv-tlabs/PiD

PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

解決する課題

PiD (Pixel Diffusion Decoder) は、潜在拡散モデルにおける従来の VAE (Variational Autoencoder) または RAE (Regularized Autoencoder) デコーダーの制限に対処します。標準的なデコードに頼るのではなく、潜在表現を単一のパスで直接超解像ピクセルに変換し、デコードとアップサンプリングのプロセスを統合して、より詳細な高解像度画像を生成します。

仕組み

PiDは、潜在からピクセルへのデコードプロセスを条件付きピクセル空間拡散モデルとして再定式化します。高解像度のピクセル空間で直接ノイズ除去を行うため、既存のデコーダーのプラグアンドプレイな代替品として機能します。FLUX、SDXL、SD3などの様々なバックボーンからの潜在表現を受け取り、2Kから4Kの解像度にデコードできます。

対象者

このツールは、生成パイプライン全体を再設計することなく、最終的な画像の解像度と鮮明度を向上させたい、潜在拡散モデルを扱う研究者や開発者向けに設計されています。

ハイライト

  • プラグアンドプレイ: FLUX、SDXL、SD3、Qwen-Imageを含む複数の人気バックボーンにおいて、標準的なVAE/RAEデコーダーを置き換えます。
  • 超解像: 潜在表現を2Kから最大4Kの解像度までデコード可能です。
  • シングルパス生成: デコードとアップサンプリングを一つの生成モジュールに統合します。
  • 柔軟な統合: さまざまなアスペクト比をサポートし、ComfyUIなどのツールと統合可能です。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト