OpenAI Summer Fellows 2018 Final Projects

Overview

OpenAIの2018年Summer Fellowsプログラムは、人工知能における重要なボトルネック、具体的には強化学習(RL)の汎化、ニューラルネットワーク訓練のスケールアップ、および生成モデルの表現力に焦点を当てた一連の研究プロジェクトで終了しました。

Reinforcement Learning and Generalization

2018年のフェローによる研究は、RLエージェントが異なる環境間で知識を転移できるようにするために、RLにおける過学習を定量化し、軽減することに焦点を当てました。

Quantifying Generalization via CoinRun

Karl Cobbeは、RLエージェントが新しい環境にどの程度汎化できるかを測定するために設計された、手続き型生成ゲームであるCoinRunを開発しました。研究の結果、訓練セットが驚くほど大きい場合でも、エージェントは訓練セットに過学習することが多いことが明らかになりました。この過学習を軽減するために、Cobbeは、以下のものを含む、より深い畳み込みアーキテクチャと教師あり学習技術を実装しました:

  • L2 regularization
  • Dropout
  • Data augmentation
  • Batch normalization

Pre-training for Sample Efficiency

Josh Meierは、エージェントがタスク間で知識を転移することに通常苦労するRL転移問題について調査しました。彼は、教師なし観察を用いて大規模な生成モデルで環境をモデル化するためにニューラルネットワークを事前学習し、その後にProximal Policy Optimization (PPO)を用いてオンポリシーでモデルを微調整することで、サンプル効率の向上とタスク間の転移の改善につながることを発見しました。このアプローチは、Transformerネットワークのスケールアップ、言語モデルの微調整、およびPPOを組み合わせたものです。

Analysis of Overfitting in RL

Xingyou (Richard) Songは、最適化と合成の両方の観点から、強化学習において発生する過学習のタイプを分析しました。彼の研究は、観察の過学習と、汎化ギャップに寄与する最適化ランドスケープ内の要因に焦点を当てました。さらに、SongはJoshua Meierと協力して、Sonic The Hedgehog環境において最先端のメソッドを評価し、なぜ特定の生成モデリングと特殊なアーキテクチャが大規模なデータセットで失敗するのかを分析しました。

Distributed Training and the Science of AI

Sam McCandlishは、分散型ニューラルネットワーク訓練のための大規模コンピューティングハードウェアの使用について研究しました。彼の研究は、MNISTからDotaまで、幅広い機械学習タスクにわたる予測可能なパターンを特定しました。具体的には、彼は、経験の量と特定のスコアを達成するために必要な訓練時間を実現するためのトレードオフが予測可能であることを発見しました。

Generative Models and Physics Priors

生成モデリングの研究は、サンプル品質、安定性、およびモデルの表現力をベンチマークするための能力の向上に焦点を当てました。

Normalizing Flow Models

Johannes Otterbachは、Normalizing Flowモデルを研究しました。これは、より単純な分布を連続的な変形を通じてデータ分布を近似するものです。彼は、これらのモデルが本質的に近似しにくい人工的なデータセットを作成し、将来の生成モデルの柔軟性と表現力を測定するためのベンチマークを提供しました。 \n### Energy-Based Models and Dynamics Knowledge

名前の記載のないフェロー(以前はMITの学部生)は、生成モデリングとRLの2つの主要な領域を調査しました:

  1. Dynamics Knowledge Integration: フェローは、より優れた長期的な物理予測のための新しいアーキテクチャを開発し、ビデオや以前の環境から学習したダイナミクス情報を新しい環境へ転移させる方法を調査しました。
  2. Energy-Based Models (EBMs): フェローは、EBMsの訓練のスケールアップと安定化に取り組みました。リプレイバッファを実装することで、フェローは、EBMsが他の最先端の尤度モデルよりも高品質なサンプルを生成できることを見つけ、、強固な分布外汎化、構成的能力、およびCIFAR-10のサンプルをインペイントおよび復元する能力を示しました。

Sources