エネルギーベースモデルのための暗黙的生成および汎化手法

OpenAIは、エネルギーベースモデル(EBM)の安定かつスケーラブルな学習手法を開発し、その結果、サンプルの品質と汎化能力が向上しました。EBMは、各入力データポイントに正規化されていない確率スカラー、すなわち「エネルギー」を割り当てることで、従来の生成モデルに代わる柔軟な選択肢を提供し、反復的な洗練を通じて暗黙的な生成を可能にします。

反復的な洗練による暗黙的生成

EBMは、Langevin dynamicsに基づく反復的な洗練プロセスを使用して、サンプルを暗黙的に生成します。これは、エネルギー関数に対してノイズを伴う勾配降下法を実行し、低エネルギーの状態に到達させるプロセスを含みます。このアプローチは、GANs、VAEs、およびFlow-basedモデルとは異なり、サンプルを生成するための明示的なニューラルネットワークを必要としません。

この暗黙的生成手法は、主に3つの技術的な利点を提供します:

  • Adaptive Computation Time: モデルは、粗いサンプルを生成するために短時間の逐次的な洗練を実行したり、鮮明で多様なサンプルを生成するために長時間の洗練を実行したりすることができます。無限時間の極限において、この手順はエネルギーモデルから真のサンプルを生成することが知られています。
  • Freedom from Generator Network Constraints: 連続的な空間から、潜在的に不連続なデータモードの空間へと写像を学習しなければならないVAEsやFlow-basedモデルとは異なり、EBMは不連続な領域に低いエネルギーを容易に割り当てることができます。
  • Built-in Compositionality: EBMは正規化されていない確率分布を表すため、Product of Experts(専門家の積)やその他の階層構造を用いて自然に組み合わせることができます。

生成能力とアプリケーション

EBMは、定性的および定量的に高品質な画像を生成できます。画像の品質は、テスト時に洗練プロセスを長く実行するほど向上します。OpenAIは、いくつかのアプリケーションを通じてこれらの能力を実証しました:

  • Image Manipulation: モデルは、画像の自動補完(inpainting)を実行したり、あるクラスから別のクラスへと画像をモーフィングしたりすることができます(例:トラックをカエルにモーフィングする)。
  • Robot Dynamics: EBMは、多くのタイムステップにわたる安定したロボットのダイナミクス軌道を生成できます。フィードフォワードモデルはしばしば平均的な予測に収束してしまいますが、EBMは同じ開始状態から多様で実行可能な将来の軌道を生成できます。

汎化と堅牢性

エネルギーベースモデルは、Flow-basedモデルや自己回帰モデルのような尤度モデルと比較して、分布外(out-of-distribution)のデータセットを含む分類タスクにおいて優れた性能を示します。

さらに、条件付きEBMは、敵対的摂動(adversarial perturbations)に対して強い汎化性能を示します。OpenAIは、EBMが分類のために特別に学習されていないにもかかわらず、敵対的摂動に対して明示的に学習されたモデルよりも分類性能が高いことを指摘しました。

学習の観察と得られた教訓

OpenAIは、EBMの学習中にいくつかの課題と観察事項を特定しました:

  • HMC Limitations: バニラなHamiltonian Monte Carlo (HMC) は、EBMの学習において適用が困難でした。なぜなら、最適なステップサイズとleapfrog simulationの回数が学習中に大きく変化するためです。
  • Ensemble Training: エネルギー関数のアンサンブル学習は、ある程度の利点を提供しましたが、追加の複雑さを正当化するほどではありませんでした。
  • Gradient Penalties: 勾配ペナルティ項の追加は、成功しなかったことが判明しました。サンプリングとモデルの容量(capacity)の両方を妨げるように見えたためです。

将来の方向性:構成可能性(Compositionality)

予備的な結果は、複数のEBMをProduct of Expertsモデルを介して構成できることを示しています。2D実験において、OpenAIは、固定された位置にある異なるサイズの形状を学習するモデルと、同じサイズで異なる位置にある形状を学習するモデルをそれぞれ学習させました。これらのモデルを組み合わせることで、システムは、両方の変数が同時に変化する例を一度も見たことがなくても、異なる位置にある異なるサイズの形状を生成することができました。

Sources