PixelCNN++: 離散化ロジスティック混合尤度およびその他の修正による PixelCNN の改善

TL;DR

OpenAI は、離散化ロジスティック混合尤度、全ピクセル条件付け、ダウンサンプリング、ショートカット接続、ドロップアウトを使用し、CIFAR‑10 で最先端の対数尤度を達成した改良版 PixelCNN モデルである PixelCNN++ を発表しました。

Overview

PixelCNN++ は、正確な尤度を提供する画像の生成モデルであり、2017 年 1 月 19 日に OpenAI によってリリースされました。リリースには GitHub 上のソースコードと、修正を説明する論文が含まれます。

Key Technical Modifications

PixelCNN++ の修正は、トレーニング速度とモデル性能の両方を向上させます。まず、モデルはピクセル値に対する 256 通りの softmax を離散化ロジスティック混合尤度に置き換え、これによりトレーニングが高速化されます。次に、個々の R/G/B サブピクセルではなく、全ピクセルに条件付けを行い、アーキテクチャを簡素化します。さらに、マルチ解像度構造を効率的に捉えるためにダウンサンプリング層が追加されます。さらに、最適化を加速するために追加のショートカット接続が導入されます。最後に、ドロップアウトが正則化子として適用されます。

Experimental Results

著者らは CIFAR‑10 データセットで PixelCNN++ を評価し、提案された変更の有効性を示す最先端の対数尤度を達成したと報告しています。

Implications

シンプルな尤度の変更とアーキテクチャの調整が PixelCNN の性能を向上させられることを示すことで、PixelCNN++ は尤度ベースの画像生成器をより強力に構築するための実践的なレシピを提供し、スケーラブルな自己回帰モデルへのさらなる研究を促進します。

Sources