圖像 GPT

OpenAI 已經推出 Image GPT (iGPT),一個將 GPT-2 Transformer 架構應用於像素序列的模型。研究表明,大型 Transformer 在下一像素預測上進行訓練後,能夠生成連貫的圖像樣本,並學習到與頂尖無監督卷積神經網路具競爭力的視覺特徵,證明了領域特定的架構先驗可以換取計算規模。

從像素進行生成式預訓練

iGPT 將圖像視為 1-D 像素序列,採用與 GPT-2 中用於自然語言相同的領域無關 Transformer 架構。透過訓練模型預測序列中的下一個像素,iGPT 能夠理解 2-D 圖像特徵,例如物體外觀和類別,而無需使用人類提供的標籤。

為了管理長序列上密集注意力的計算成本,OpenAI 採用了以下方法:

  • 低解析度: 訓練在 32x32、48x48 和 64x64 的解析度下進行。
  • 自訂顏色調色板: 建立了一個 9 位元的顏色調色板來表示像素,與標準 RGB 調色板相比,輸入序列長度減少了三倍,同時保持顏色保真度。
  • 模型規模: 訓練了四個版本:iGPT-S (76M 參數)、iGPT-M (455M)、iGPT-L (1.4B) 和 iGPT-XL (6.8B)。

生成與分類之間的關聯

研究建立了模型生成性能與其執行圖像分類能力之間的直接連結。OpenAI 發現,隨著模型規模的增加和訓練迭代的繼續,生成品質提升,這直接轉化為下游任務中更高的特徵品質。

特徵提取與深度

特徵品質在網路中並不均勻。OpenAI 觀察到,用於圖像分類的最佳特徵位於網路的中間層,而不是最終層。這表明存在兩階段操作:

  1. 情境化: 模型從周圍像素收集資訊以建立情境化的圖像特徵。
  2. 預測: 模型利用該特徵來解決條件下一像素預測任務。

實驗結果與基準

iGPT 在多個資料集上使用線性探針(在學習特徵上進行邏輯迴歸)和完整微調進行評估。

無監督表現

在多個資料集上,iGPT-L (32x32) 在使用線性探針時優於其他監督和無監督遷移演算法:

  • CIFAR-10: 96.3% 準確率(相比之下,SimCLR 為 95.3%)。
  • CIFAR-100: 82.8% 準確率(相比之下,SimCLR 為 80.2%)。
  • STL-10: 95.5% 準確率(相比之下,AMDIM 為 94.2%)。

在 ImageNet 上,iGPT-XL (64x64) 使用來自五層的 15,360 個特徵達成了 72.0% 的 top-1 準確率,優於 AMDIM、MoCo 和 CPC v2,但仍低於 SimCLR 的 76.5%。

與 BERT 風格預訓練的比較

OpenAI 測試了一種類似 BERT 的遮蔽像素方法(遮蔽 15% 的像素)。儘管 BERT 風格的模型在線性探針上的表現顯著較差,但在完整微調過程中,它們與生成模型具有競爭力。

半監督學習

使用簡單的線性探針在未增強的圖像上,iGPT-L 在低資料 CIFAR-10 上優於 Mean Teacher 和 MixMatch,儘管它在 FixMatch 上表現不佳。

局限與計算成本

儘管具有這些表現,iGPT 由於缺乏領域特定先驗而存在顯著的實際限制:

  • 計算強度: iGPT-L 需要約 2,500 個 V100 天的訓練,而同等性能的 MoCo 模型則僅需約 70 個 V100 天。
  • 解析度限制: 由於其使用 Transformer 而非卷積編碼器,iGPT 限於低解析度輸入。若要擴展到更高解析度,可能需要新架構,例如多尺度 Transformer。
  • 演算法偏差: 作為生成模型,iGPT 可能會繼承並放大其訓練資料中存在的偏差,導致不公平或不具代表性的圖像補全。

結論

iGPT 證明了大規模序列 Transformer 可以在無需手刻架構知識的情況下,在新領域學習到優秀的無監督表示。透過用計算規模換取 2-D 空間先驗,iGPT 展示了 GPT 架構的簡單與通用性可以從語言有效擴展到視覺。

Sources