OpenAI 生成模型研究概覽

OpenAI 正在利用生成模型——無監督學習技術,訓練神經網路生成與大型訓練集相似的數據——來賦予電腦對物理與數位世界的基本理解。透過迫使模型將大量數據壓縮到較少的參數中,網路必須發現並內化數據的基本特徵,才能成功重建它。

生成建模的核心方法

生成建模旨在使模型的分佈與資料集的真實數據分佈相匹配。OpenAI 辨識出實現此目標的三種主要技術方法:

  • 生成對抗網路 (GANs): 這些透過兩個網路間的競爭遊戲來實現。生成器產生樣本,而判別器嘗試將它們分類為真實或偽造。生成器會反覆改進,使其樣本與真實數據無法區分。
  • 變分自動編碼器 (VAEs): 這些使用概率圖形模型來最大化數據對數似然的下界,從而允許高效的貝葉斯推斷。
  • 自回歸模型(例如 PixelRNN): 這些基於先前像素(左側和上方)建模單個像素的條件分佈,將圖像生成視為類似於文本序列生成的過程。

模型類型之間的權衡

模型類型 優點 缺點
GANs 產生最銳利的圖像;學習有價值的紋理碼。 優化困難;訓練動態不穩定。
VAEs 在複雜模型中支援高效的貝葉斯推斷。 生成的樣本傾向於模糊。
PixelRNNs 訓練簡單且穩定;對數似然最佳。 採樣效率低;缺乏簡單的低維碼。

關鍵研究貢獻

OpenAI 已發佈五個項目,推動生成建模及其在強化學習(RL)中的應用達到最先進狀態。

改進 GAN 穩定性與半監督學習

為了解決 GANs 的不穩定性和「崩潰」傾向,OpenAI 引入了穩定訓練的技術,使得能夠生成 $128 imes128$ 的 ImageNet 樣本。

此外,OpenAI 開發了一種半監督學習方法,其中判別器為輸入提供標籤。這使得在僅有少量標註樣本的情況下也能達成高準確率;例如,僅使用每類 10 個標註樣本,在 MNIST 上達到 99.14% 的準確率。

透過逆自回歸流(IAF)改進 VAE

為了克服 latent 變數獨立的粗糙近似後驗的限制,OpenAI 提出了 逆自回歸流(IAF)。此方法平行化計算豐富的近似後驗,使其比先前的序列依賴方法更具彈性且在計算上更具可擴展性。

InfoGAN:無監督的解耦表示

InfoGAN 是 GANs 的擴展,能在不需要額外監督的情況下學習圖像的可解釋且解耦的表示。透過最大化表示變數的小子集與觀測值之間的互信息,模型能自動發現顯著特徵——例如 3D 人臉的相機角度、光照或面部變化——而無需被明確告知這些特徵存在。

生成模型在強化學習中的應用

OpenAI 將生成組件應用於兩個具體的強化學習挑戰:

  1. VIME (好奇心驅動探索): VIME 利用生成模型的不確定性,使代理變得自我激勵,尋求「令人驚訝」的狀態-動作。這在高維空間且獎勵稀疏的情況下改進了政策搜索,例如學習運動原始動作。
  2. 生成對抗模仿學習: 此方法利用基於 GAN 的框架,直接從專家示範中提取政策。這消除了手動設計複雜獎勵函數的需求,使得在困難的 OpenAI Gym 環境(如 Ant 和 Humanoid)中學習政策成為可能。

未來影響

調整生成模型與資料集的規模預計將導致創造出完全真實感的圖像與影片。除了按需求藝術或進階圖像編輯等創意應用外,這些模型在圖像去噪、填充、超解析度以及神經網路預訓練等技術任務上至關重要。最終目標是讓訓練過程為電腦提供對世界結構的理解。

Sources