nv-tlabs/PiD
PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
해결하는 문제
PiD (Pixel Diffusion Decoder)는 잠재 확산 모델에서 기존 VAE (Variational Autoencoder) 또는 RAE (Regularized Autoencoder) 디코더의 한계를 해결합니다. 표준 디코딩에 의존하는 대신, 잠재 표현을 단 한 번의 패스로 직접 초해상도 픽셀로 변환하여 디코딩과 업샘플링 프로세스를 통합함으로써 더 나은 디테일을 가진 고해상도 이미지를 생성합니다.
작동 원리
PiD는 잠재-픽셀 디코딩 프로세스를 조건부 픽셀 공간 확산 모델로 재구성합니다. 고해상도 픽셀 공간에서 직접 노이즈를 제거하므로 기존 디코더를 대체하는 플러그 앤 플레이 방식으로 작동할 수 있습니다. FLUX, SDXL, SD3와 같은 다양한 백본의 잠재 표현을 받아 2K에서 4K 범위의 해상도로 디코딩할 수 있습니다.
대상 사용자
이 도구는 전체 생성 파이프라인을 재설계할 필요 없이 최종 이미지의 해상도와 선명도를 높이고 싶은 잠재 확산 모델 연구자 및 개발자를 위해 설계되었습니다.
주요 특징
- 플러그 앤 플레이: FLUX, SDXL, SD3, Qwen-Image를 포함한 여러 인기 백본에서 표준 VAE/RAE 디코더를 대체합니다.
- 초해상도: 잠재 표현을 2K 및 최대 4K 해상도로 디코딩할 수 있습니다.
- 싱글 패스 생성: 디코딩과 업샘플링을 하나의 생성 모듈로 통합합니다.
- 유연한 통합: 다양한 종횡비를 지원하며 ComfyUI와 같은 도구와 통합됩니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트