OpenAI Summer Fellows 2018 Final Projects

Overview

OpenAI 的 2018 Summer Fellows 项目圆满结束,该项目推出了一系列针对人工智能关键瓶颈的研究项目,特别是强化学习 (RL) 的泛化能力、神经网络训练的可扩展性以及生成模型的表达能力。

Reinforcement Learning and Generalization

2018 年的 Fellows 研究重点在于量化并减轻 RL 智能体在强化学习中的过拟合问题,以确保它们能够跨不同环境迁移知识。

Quantifying Generalization via CoinRun

Karl Cobbe 开发了 CoinRun,这是一款程序化生成的游戏,旨在衡量 RL 智能体对新环境的泛化能力。研究表明,智能体经常会对训练集产生过拟合,即使这些训练集规模庞大得令人惊讶。为了减少这种过拟合,Cobbe 实施了更深的卷积架构和监督学习技术,包括:

  • L2 regularization
  • Dropout
  • Data augmentation
  • Batch normalization

Pre-training for Sample Efficiency

Josh Meier 调查了 RL 迁移问题,即智能体通常难以在任务之间迁移知识。他发现,先使用大型生成模型在无监督观测数据上对神经网络进行预训练以建模环境,然后使用 Proximal Policy Optimization (PPO) 进行在策略 (on-policy) 微调,可以提高样本效率并改善跨任务迁移。这种方法结合了扩展 Transformer 网络、微调语言模型和 PPO。

Analysis of Overfitting in RL

Xingyou (Richard) Song 分析了从优化和合成两个角度来看强化学习中发生的过拟合类型。他的工作重点在于观测过拟合以及优化景观 (optimization landscape) 中导致泛化差距的因素。此外,Song 与 Joshua Meier 合作,在 Sonic The Hedgehog 环境中评估了最先进的方法,分析了为什么某些生成建模和特殊架构在大型数据集上表现不佳。

Distributed Training and the Science of AI

Sam McCandlish 研究了使用大规模计算硬件进行分布式神经网络训练。他的研究识别出了从 MNIST 到 Dota 的各种机器学习任务中存在的预测模式。具体而言,他发现,经验量与达到特定分数所需的训练时间之间的权衡是可以预测的。

Generative Models and Physics Priors

生成建模研究重点在于提高样本质量、稳定性和衡量模型表达能力的能力。

Normalizing Flow Models

Johannes Otterbach 研究了 Normalizing Flow 模型,这类模型通过对简单分布进行连续变形来近似数据分布。他创建了人工数据集,这些数据集本质上难以被这些模型近似,从而为未来的生成模型提供了衡量其灵活性和表达能力的基准。

Energy-Based Models and Dynamics Knowledge

一位未具名的 Fellow (此前是 MIT undergrad) 探索了生成建模和 RL 的两个主要领域:

  1. Dynamics Knowledge Integration: 开发者开发了一种新的架构,以实现更好的长期物理预测,并探索了将从视频和先前环境中学到的动力学信息迁移到新环境中的方法。
  2. Energy-Based Models (EBMs): 该 Fellow 致力于扩展和稳定 EBMs 的训练。通过实施一个 replay buffer,该 Fellow 发现 EBMs 可以比其他最先进的似然模型生成更高质量的样本,并展示了强大的分布外泛化能力、组合能力以及对 CIFAR-10 样本进行修复和恢复的能力。

Sources