nv-tlabs/PiD
PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
解決的問題
PiD (Pixel Diffusion Decoder) 解決了潛在擴散模型中傳統 VAE (Variational Autoencoder) 或 RAE (Regularized Autoencoder) 解碼器的局限性。它不依賴於標準解碼,而是透過單次傳遞將潛在表示直接轉換為超解析度像素,將解碼與上採樣過程統一,以產生細節更豐富的高解析度圖像。
工作原理
PiD 將潛在到像素的解碼過程重新定義為條件像素空間擴散模型。它直接在高解析度像素空間中進行去噪,使其能夠作為現有解碼器的即插即用替代方案。它可以接收來自各種骨幹網路(如 FLUX、SDXL 或 SD3)的潛在表示,並將其解碼為 2K 到 4K 範圍的分辨率。
適用對象
該工具專為處理潛在擴散模型的研發人員設計,旨在無需重新設計整個生成流水線的情況下,提高最終圖像的分辨率與清晰度。
亮點
- 即插即用:可替換包括 FLUX、SDXL、SD3 和 Qwen-Image 在內的多種流行骨幹網路的標準 VAE/RAE 解碼器。
- 超解析度:能夠將潛在表示解碼為 2K 及高達 4K 的解析度。
- 單次傳遞生成:將解碼與上採樣統一到一個生成模組中。
- 靈活整合:支援各種長寬比,並能與 ComfyUI 等工具整合。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案