nv-tlabs/PiD

PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

解决的问题

PiD (Pixel Diffusion Decoder) 解决了潜在扩散模型中传统 VAE (Variational Autoencoder) 或 RAE (Regularized Autoencoder) 解码器的局限性。它不依赖于标准解码,而是通过单次传递将潜在表示直接转换为超分辨率像素,将解码和上采样过程统一起来,从而生成细节更丰富的更高分辨率图像。

工作原理

PiD 将潜在到像素的解码过程重新定义为条件像素空间扩散模型。它直接在高分辨率像素空间中进行去噪,使其能够作为现有解码器的即插即用替代方案。它可以接收来自各种骨干网络(如 FLUX、SDXL 或 SD3)的潜在表示,并将其解码为 2K 到 4K 范围的分辨率。

适用对象

该工具专为处理潜在扩散模型的研发人员设计,旨在无需重新设计整个生成流水线的情况下,提高最终图像的分辨率和清晰度。

亮点

  • 即插即用:可替换包括 FLUX、SDXL、SD3 和 Qwen-Image 在内的多种流行骨干网络的标准 VAE/RAE 解码器。
  • 超分辨率:能够将潜在表示解码为 2K 及高达 4K 的分辨率。
  • 单次传递生成:将解码和上采样统一到一个生成模块中。
  • 灵活集成:支持各种长宽比,并能与 ComfyUI 等工具集成。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目