nv-tlabs/PiD
PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
解决的问题
PiD (Pixel Diffusion Decoder) 解决了潜在扩散模型中传统 VAE (Variational Autoencoder) 或 RAE (Regularized Autoencoder) 解码器的局限性。它不依赖于标准解码,而是通过单次传递将潜在表示直接转换为超分辨率像素,将解码和上采样过程统一起来,从而生成细节更丰富的更高分辨率图像。
工作原理
PiD 将潜在到像素的解码过程重新定义为条件像素空间扩散模型。它直接在高分辨率像素空间中进行去噪,使其能够作为现有解码器的即插即用替代方案。它可以接收来自各种骨干网络(如 FLUX、SDXL 或 SD3)的潜在表示,并将其解码为 2K 到 4K 范围的分辨率。
适用对象
该工具专为处理潜在扩散模型的研发人员设计,旨在无需重新设计整个生成流水线的情况下,提高最终图像的分辨率和清晰度。
亮点
- 即插即用:可替换包括 FLUX、SDXL、SD3 和 Qwen-Image 在内的多种流行骨干网络的标准 VAE/RAE 解码器。
- 超分辨率:能够将潜在表示解码为 2K 及高达 4K 的分辨率。
- 单次传递生成:将解码和上采样统一到一个生成模块中。
- 灵活集成:支持各种长宽比,并能与 ComfyUI 等工具集成。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目