OpenAI Variational Lossy Autoencoder 研究

OpenAIは、ニューラル自己回帰モデルを統合し、2D画像のテクスチャなどの関係のない情報を選択的に破棄することでグローバルな表現を学習するVariational Lossy Autoencoder(VAE)を開発しました。このアプローチは生成モデリングの性能を向上させ、MNIST、OMNIGLOT、Caltech-101 シルエットの密度推定タスクにおいて最先端の結果を達成しました。

損失オートエンコーディングによるグローバル表現学習

表現学習の主な目的は、観測されたデータの特定の側面を分離し、分類などのダウンストリームタスクを容易にすることです。Variational Lossy Autoencoderは、グローバルな潜在コードを強制して関係のない情報を破棄することでこれを達成し、実際には「損失」オートエンコーディングを行います。たとえば、2D画像では、詳細なテクスチャを無視しながらグローバルな構造を捉えるようにモデルを設計できます。

ニューラル自己回帰モデルの統合

生成性能を向上させるため、OpenAIモデルはニューラル自己回帰モデル—具体的にはRNN、MADE、PixelRNN/CNN—を、事前分布$p(z)$および復号分布$p(x|z)$の両方として活用します。このアーキテクチャの組み合わせにより、標準的なVAEと比較して、より高品質な生成とより正確な密度推定を実現できます。

ベンチマークとパフォーマンス

VAEと自己回帰モデルを組み合わせることにより、研究チームは以下の特定のデータセットにおける密度推定タスクで新たな最先端の結果を達成しました:

  • MNIST
  • OMNIGLOT
  • OMNIGLOT
  • Caltech-101 シルエット

Sources