使用 CLIP 潛向的階層式文字條件圖像生成
OpenAI 引入了一種階層式的文字條件圖像生成方法,利用 CLIP(對比語言-圖像預訓練)的潛向。透過將過程拆分為先驗模型與解碼器,該模型提升了圖像的多樣性,並啟用如零樣本圖像操作等進階功能。
兩階段生成架構
該系統作為一個兩階段模型運作,旨在利用 CLIP 所學得的強大語意與風格表徵。
先驗模型
第一階段是先驗模型,根據文字說明產生 CLIP 圖像嵌入。OpenAI 為此元件試驗了自回歸模型與擴散模型。研究人員發現,先驗的擴散模型在計算上更有效率,且產生的樣本品質高於自回歸版本。
解碼器
第二階段是解碼器,接收先驗產生的圖像嵌入,並在此嵌入的條件下生成最終圖像。研究人員在解碼階段使用了擴散模型。
主要技術改進與能力
提升圖像多樣性
先行明確產生圖像表徵(CLIP 潛向)可提升生成圖像的多樣性,同時在寫實度與與原始文字說明的相似性上僅有極小的損失。
語意與風格保留
由於解碼器以 CLIP 圖像表徵為條件,它能產生圖像的變體,保留原始的核心語意與風格,同時變化那些未被圖像表徵捕捉的非必要細節。
零樣本圖像操作
CLIP 的聯合嵌入空間允許以語言指導的零樣本圖像操作。這意味著模型能根據文字提示修改圖像,無需針對特定編輯進行專門訓練。
模型元件概覽
| 元件 | 使用的模型類型 | 主要功能 |
|---|---|---|
| Prior | 擴散模型 | 文字說明 $\rightarrow$ CLIP 圖像嵌入 |
| Decoder | 擴散模型 | CLIP 圖像嵌入 $\rightarrow$ 最終圖像 |