OpenAI Summer Fellows 2018 Final Projects

Overview

OpenAI 的 2018 Summer Fellows 計畫已圓滿結束,該計畫推出了一系列針對人工智慧關鍵瓶頸的研究專案,特別是在強化學習 (RL) 的泛化能力、神經網路訓練的可擴展性,以及生成模型的表達能力方面。

Reinforcement Learning and Generalization

2018 年的實習生所進行的研究,重點在於量化並減輕 RL 代理人在強化學習中的過擬合 (overfitting) 問題,以確保他們能夠在不同環境之間轉移知識。

Quantifying Generalization via CoinRun

Karl Cobbe 開發了 CoinRun,這是一款程序化生成的遊戲,旨在衡量 RL 代理人在新環境中的泛化能力。研究結果顯示,代理人在訓練集即使在規模驚人地大時,也經常會對訓練集產生過擬合。為了減少這種過擬合,Cobbe 實施了更深層的卷積架構與監督式學習技術,包括:

  • L2 regularization
  • Dropout
  • Data augmentation
  • Batch normalization

Pre-training for Sample Efficiency

Josh Meier 探討了 RL 轉移問題,即代理人在不同任務之間轉移知識時通常會遇到困難。他發現,先使用大型生成模型在無監督觀察中對神經網路進行預訓練,以建模環境,接著再使用 Proximal Policy Optimization (PPO) 進行在策略 (on-policy) 微調,可以提高樣本效率並改善跨任務的轉移能力。這種方法結合了擴展 Transformer 網路、微調語言模型以及 PPO。

Analysis of Overfitting in RL

Xingyou (Richard) Song 分析了強化學習中從優化與合成觀點來看會發生的過擬合類型。他的工作重點在於觀察過擬合 (observation overfitting) 以及優化景觀 (optimization landscape) 中導致泛化差距 (generalization gaps) 的因素。此外,Song 與 Joshua Meier 合作,在 Sonic The Hedgehog 環境中評估了尖端技術,分析了為什麼某些生成建模與特殊架構在大型數據集上會失敗。

Distributed Training and the Science of AI

Sam McCandlish 研究了使用大規模計算硬體進行分散式神經網路訓練。他的研究識別出了涵蓋從 MNIST 到 Dota 等各種機器學習任務的可預測模式。具體而言,他發現,經驗量與達到特定分數所需的訓練時間之間的權衡 (tradeoff) 是可以預測的。

Generative Models and Physics Priors

生成建模的研究重點在於提高樣本品質、穩定性,以及衡量模型表達能力的能力。

Normalizing Flow Models

Johannes Otterbach 研究了 Normalizing Flow 模型,這類模型透過對較簡單的分佈進行連續變形來逼近數據分佈。他創建了人工數據集,這些數據集在本質上很難被這些模型逼近,從而為未來的生成模型提供了一個衡量其靈活性與表達能力的基準。

Energy-Based Models and Dynamics Knowledge

一位未具名的實習生(先前為 MIT 大學生)探索了生成建模與 RL 的兩個主要領域:

  1. Dynamics Knowledge Integration: 實習生開發了一種新架構,以實現更好的長期物理預測,並探索了將從影片與先前環境中學習到的動力學資訊轉移到新環境中的方法。
  2. Energy-Based Models (EBMs): 實習生致力於擴展與穩定 EBMs 的訓練。透過實施 replay buffer,實習生發現 EBMs 可以比其他尖端似然模型 (likelihood models) 生成更高品質的樣本,並展現出強大的分布外 (out-of-distribution) 泛化能力、組合能力,以及對 CIFAR-10 樣本進行修補 (inpaint) 與修復的能力。

Sources