使用 CLIP 潛向的階層式文字條件圖像生成

OpenAI 引入了一種階層式的文字條件圖像生成方法,利用 CLIP(對比語言-圖像預訓練)的潛向。透過將過程拆分為先驗模型與解碼器,該模型提升了圖像的多樣性,並啟用如零樣本圖像操作等進階功能。

兩階段生成架構

該系統作為一個兩階段模型運作,旨在利用 CLIP 所學得的強大語意與風格表徵。

先驗模型

第一階段是先驗模型,根據文字說明產生 CLIP 圖像嵌入。OpenAI 為此元件試驗了自回歸模型與擴散模型。研究人員發現,先驗的擴散模型在計算上更有效率,且產生的樣本品質高於自回歸版本。

解碼器

第二階段是解碼器,接收先驗產生的圖像嵌入,並在此嵌入的條件下生成最終圖像。研究人員在解碼階段使用了擴散模型。

主要技術改進與能力

提升圖像多樣性

先行明確產生圖像表徵(CLIP 潛向)可提升生成圖像的多樣性,同時在寫實度與與原始文字說明的相似性上僅有極小的損失。

語意與風格保留

由於解碼器以 CLIP 圖像表徵為條件,它能產生圖像的變體,保留原始的核心語意與風格,同時變化那些未被圖像表徵捕捉的非必要細節。

零樣本圖像操作

CLIP 的聯合嵌入空間允許以語言指導的零樣本圖像操作。這意味著模型能根據文字提示修改圖像,無需針對特定編輯進行專門訓練。

模型元件概覽

元件 使用的模型類型 主要功能
Prior 擴散模型 文字說明 $\rightarrow$ CLIP 圖像嵌入
Decoder 擴散模型 CLIP 圖像嵌入 $\rightarrow$ 最終圖像

Sources