OpenAI 生成模型研究概览

OpenAI 正在利用生成模型——一种无监督学习技术,它训练神经网络生成与大型训练集相似的数据——来赋予计算机对物理和数字世界的基本理解。通过迫使模型将海量数据压缩到较少的参数中,网络必须发现并内化数据的基本特征,以便成功地重新创建它。

生成建模的核心方法

生成建模旨在将模型的分布与数据集的真实数据分布相匹配。OpenAI 确定了实现这一目标的三种主要技术方法:

  • 生成对抗网络(GANs): 这些方法在两个网络之间进行竞争博弈。生成器生成样本,而判别器试图将其分类为真实或虚假。生成器通过迭代改进,使其生成的样本与真实数据无法区分。
  • 变分自编码器(VAEs): 这些方法使用概率图模型来最大化数据对数似然的下界,从而实现高效的贝叶斯推断。
  • 自回归模型(例如,PixelRNN): 这些方法基于之前的像素(左侧和上方)建模单个像素的条件分布,将图像生成视为类似于文本中的序列生成。

模型类型之间的权衡

模型类型 优势 劣势
GANs 生成最清晰的图像;学习有价值的纹理代码。 难以优化;训练动态不稳定。
VAEs 在复杂模型中支持高效的贝叶斯推断。 生成的样本往往模糊。
PixelRNNs 训练简单且稳定;对数似然最佳。 采样效率低;缺乏简单的低维码。

关键研究贡献

OpenAI 已发布五个项目,推动了生成建模及其在强化学习(RL)中的应用的最新进展。

改进 GAN 稳定性和半监督学习

为了解决 GANs 的不稳定性和“模式崩塌”倾向,OpenAI 引入了稳定训练的技术,使得能够生成 $128\times128$ 的 ImageNet 样本。

此外,OpenAI 开发了一种半监督学习方法,其中判别器为输入提供标签。这使得在只有很少标注样本的情况下也能实现高准确率;例如,仅使用每类 10 个标注样本,在 MNIST 上达到 99.14% 的准确率。

通过逆自回归流(IAF)改进 VAE

为了克服近似后验过于粗糙、导致潜在变量相互独立的限制,OpenAI 引入了 逆自回归流(IAF)。该方法并行计算丰富的近似后验,使其比以前的顺序依赖方法更具灵活性和计算可扩展性。

InfoGAN:无监督解耦表示

InfoGAN 是 GANs 的一种扩展,能够在不需要额外监督的情况下学习图像的可解释和解耦表示。通过最大化表示变量的小子集与观测值之间的互信息,模型可以自动发现显著特征——例如相机角度、照明或 3D 人脸的面部变化——而无需被明确告知这些特征存在。

生成模型在强化学习中的应用

OpenAI 将生成模型组件应用于两个具体的 RL 挑战:

  1. VIME(好奇心驱动的探索): VIME 利用生成模型的不确定性使代理自我激励,寻求“令人惊讶”的状态-动作。这改善了在高维空间且奖励稀疏的环境中的策略搜索,例如学习运动原语。
  2. 生成对抗模仿学习: 该方法基于 GAN 框架,直接从专家演示中提取策略。这消除了手动设计复杂奖励函数的需求,使得在诸如 Ant 和 Humanoid 等困难的 OpenAI Gym 环境中能够学习策略。

未来影响

扩展生成模型和数据集预计将导致完全逼真的图像和视频的创建。除了按需艺术或高级图像编辑等创意应用之外,这些模型在图像去噪、填充、超分辨率和神经网络预训练等技术任务中至关重要。最终,目标是让训练过程为计算机提供对世界结构的理解。

Sources