层次化文本条件图像生成与 CLIP 潜在向量
OpenAI 引入了一种层次化的文本条件图像生成方法,利用 CLIP(对比语言-图像预训练)潜在向量。通过将过程拆分为先验和解码器,模型提升了图像的多样性,并实现了诸如零样本图像编辑等高级功能。
两阶段生成架构
该系统作为一个两阶段模型运行,旨在利用 CLIP 学习到的强大语义和风格表示。
先验
第一阶段是先验,它在给定文本描述的情况下生成 CLIP 图像嵌入。OpenAI 对该组件尝试了自回归模型和扩散模型。研究人员发现,先验使用扩散模型在计算上更高效,并且生成的样本质量高于自回归版本。
解码器
第二阶段是解码器,它接收先验生成的图像嵌入,并在此嵌入的条件下生成最终图像。研究人员在解码器阶段使用了扩散模型。
关键技术改进与能力
提升的图像多样性
首先显式生成图像表示(CLIP 潜在向量)能够提升生成图像的多样性,同时在真实感和与原始文本描述的相似度上仅有极小的损失。
语义与风格保持
由于解码器以 CLIP 图像表示为条件,它能够生成图像的变体,在保持原始核心语义和风格的同时,对图像表示未捕获的非关键细节进行变化。
零样本图像编辑
CLIP 的联合嵌入空间使得可以在零样本情况下进行语言引导的图像编辑。这意味着模型能够根据文本提示修改图像,而无需针对这些特定编辑进行专门训练。
模型组件概览
| 组件 | 使用的模型类型 | 主要功能 |
|---|---|---|
| 先验 | 扩散模型 | 文本描述 $\rightarrow$ CLIP 图像嵌入 |
| 解码器 | 扩散模型 | CLIP 图像嵌入 $\rightarrow$ 最终图像 |