Image GPT

OpenAI 推出了 Image GPT (iGPT),这是一种将 GPT-2 transformer 架构应用于像素序列的模型。该研究表明,在下一像素预测上训练的大型 transformer 可以生成连贯的图像样本,并学习到足以与顶尖无监督卷积神经网络相媲美的视觉特征,这证明了领域特定的架构先验可以被计算规模所取代。

从像素进行生成式预训练

iGPT 将图像视为 1-D 像素序列,应用了与 GPT-2 在自然语言处理中使用的相同的领域无关 transformer 架构。通过训练模型预测序列中的下一个像素,iGPT 能够在不使用人工提供的标签的情况下,学习理解 2-D 图像特征,例如物体外观和类别。

为了管理长序列上密集注意力机制的计算成本,OpenAI 采用了以下方法:

  • Low Resolution: 训练是在 32x32、48x48 和 64x64 的分辨率下进行的。
  • Custom Color Palette: 创建了一个 9-bit 颜色调色板来表示像素,与标准 RGB 调色板相比,将输入序列长度减少了三倍,同时保持了色彩保真度。
  • Model Scales: 训练了四个版本:iGPT-S (76M parameters)、iGPT-M (455M)、iGPT-L (1.4B) 和 iGPT-XL (6.8B)。

生成与分类之间的相关性

该研究建立了模型的生成性能与其执行图像分类能力之间的直接联系。OpenAI 发现,随着模型规模的增加和训练迭代的持续,生成质量得到了提高,这直接转化为下游任务中更高的特征质量。

特征提取与深度

特征质量在网络中并不是均匀分布的。OpenAI 观察到,用于图像分类的最佳特征位于网络的中间层,而不是最终层。这表明存在一个两阶段操作:

  1. Contextualization: 模型从周围像素收集信息以构建上下文化的图像特征。
  2. Prediction: 模型使用该特征来解决条件下一像素预测任务。

实验结果与基准测试

iGPT 通过线性探测 (linear probes,即在学习到的特征上进行逻辑回归) 和全量微调 (full fine-tuning) 在多个数据集上进行了评估。

无监督性能

在 several 种数据集上,iGPT-L (32x32) 使用线性探测在表现优于其他有监督和无监督迁移算法:

  • CIFAR-10: 96.3% 准确率 (相比于 SimCLR 的 95.3%)。
  • CIFAR-100: 82.8% 准确率 (相比于 SimCLR 的 80.2%)。
  • STL-10: 95.5% 准确率 (相比于 AMDIM 的 94.2%)。

在 ImageNet 上,iGPT-XL (64x64) 使用来自五个层的 15,360 个特征,实现了 72.0% 的 top-1 准确率,优于 AMDIM、MoCo 和 CPC v2,尽管它仍低于 SimCLR 的 76.5%。

与 BERT-style Pre-training 的比较

OpenAI 试了类似 BERT 的掩码像素方法 (masking 15% of pixels)。虽然 BERT-style 模型在线性探测上的表现显著较差,但在全量微调期间,它们与生成式模型具有竞争力。

半监督学习

使用在非增强图像上的简单线性探测,iGPT-L 在低数据量的 CIFAR-10 上优于 Mean Teacher 和 MixMatch,尽管其表现不及 FixMatch。

局限性与计算成本

尽管其性能,iGPT 由于缺乏领域特定的先验知识,存在显著的实际局限性:

  • Compute Intensity: iGPT-L 需要大约 2,500 V100-days 的训练,而性能相似的 MoCo 模型仅需大约 70 V100-days。
  • Resolution Constraints: 由于它使用 transformer 而不是卷积编码器,iGPT 被限制在低分辨率输入。扩展到更高分辨率可能需要一种新的架构,例如 multiscale transformer。
  • Algorithmic Bias: 作为一种生成式模型,iGPT 可能会继承并放大训练数据中存在的偏差,从而可能导致不公平或不具代表性的图像补全。

结论

iGPT 证明了一个概念,即大规模序列 transformer 可以学习到卓越的无监督表示,而无需手写代码的架构知识。通过用计算规模取代 2-D 空间先验,iGPT 证明了 GPT 架构的简单性和通用性可以有效地从语言扩展到视觉领域。

Sources