CLIP 잠재 변수를 이용한 계층적 텍스트 조건 이미지 생성

두 단계 생성 아키텍처

프라이어

첫 번째 단계는 프라이어이며, 텍스트 캡션을 입력받아 CLIP 이미지 임베딩을 생성합니다. OpenAI는 이 구성 요소에 대해 자동회귀 모델과 확산 모델을 모두 실험했습니다. 연구자들은 프라이어에 대한 확산 모델이 계산 효율성이 더 높고 자동회귀 버전보다 더 높은 품질의 샘플을 생성한다는 것을 발견했습니다.

디코더

두 번째 단계는 디코더이며, 프라이어가 생성한 이미지 임베딩을 받아 해당 임베딩을 조건으로 최종 이미지를 생성합니다. 연구자들은 디코더 단계에 확산 모델을 활용했습니다.

핵심 기술 개선 및 기능

향상된 이미지 다양성

이미지 표현(CLP 잠재 변수)을 먼저 명시적으로 생성함으로써, 원본 텍스트 캡션과의 사진 실감도 및 유사성을 최소한으로 손실하면서 생성된 이미지의 다양성을 향상시킵니다.

의미 및 스타일 보존

디코더가 CLIP 이미지 표현을 조건으로 하기 때문에, 원본의 핵심 의미와 스타일을 유지하면서 이미지 표현에 포착되지 않은 비핵심 세부 사항을 변형한 이미지 변형을 생성할 수 있습니다.

제로샷 이미지 조작

CLIP의 공동 임베딩 공간은 제로샷 방식으로 언어 기반 이미지 조작을 가능하게 합니다. 이는 모델이 특정 편집을 위한 별도 학습 없이도 텍스트 프롬프트에 따라 이미지를 변경할 수 있음을 의미합니다.

모델 구성 요소 요약

구성 요소 사용된 모델 유형 주요 기능
Prior Diffusion Model Text Caption $\rightarrow$ CLIP Image Embedding
Decoder Diffusion Model CLIP Image Embedding $\rightarrow$ Final Image

Sources