PixelCNN++: 改進 PixelCNN,使用離散化 logistic 混合 likelihood 與其他修改

TL;DR

OpenAI 宣布 PixelCNN++,這是一個改進的 PixelCNN 模型,使用離散化 logistic 混合 likelihood、整像素條件、下採樣、捷徑連接和 dropout,並報告在 CIFAR‑10 上達到最先進的 log likelihood。

Overview

PixelCNN++ 是一種提供精確 likelihood 的圖像生成模型,於 2017 年 1 月 19 日由 OpenAI 發布。該發布包含 GitHub 上的原始碼以及描述修改的論文。

Key Technical Modifications

PixelCNN++ 的修改同時提升了訓練速度和模型性能。首先,模型將像素值上的 256‑way softmax 替換為離散化 logistic 混合 likelihood,從而加速訓練。其次,它條件於整像素,而非單獨的 R/G/B 次像素,簡化了架構。第三,加入下採樣層以高效捕捉多分辨率結構。第四,引入額外的捷徑連接以加速優化。第五,dropout 被作為正則化器應用。

Experimental Results

作者在 CIFAR‑10 資料集上評估了 PixelCNN++,並報告其達成了最先進的 log likelihood,顯示所提出修改的有效性。

Implications

透過展示簡單的 likelihood 改變和架構調整即可提升 PixelCNN 性能,PixelCNN++ 提供了一種構建更強 likelihood‑based 圖像生成器的實用配方,並鼓勵對可擴展自回歸模型的進一步研究。

Sources