Image GPT

OpenAIは、GPT-2のtransformerアーキテクチャをピクセルのシーケンスに適用するモデル、Image GPT (iGPT) を発表しました。この研究は、次ピクセル予測によって訓練された大規模なtransformerが、一貫性のある画像サンプルを生成し、トップクラスの教師なし畳み込みニューラルネットワークに匹敵する視覚的特徴を学習できることを示しており、ドメイン固有のアーキテクチャの事前知識を計算スケールと交換できることを証明しています。

Generative Pre-training from Pixels

iGPTは画像を1次元のピクセルシーケンスとして扱い、GPT-2で自然言語に使用されるドメインに依存しないtransformerアーキテクチャを適用します。シーケンス内の次のピクセルを予測するようにモデルを訓練することで、iGPTは、人間が提供するラベルを使用することなく、物体の外観やカテゴリなどの2次元の画像特性を理解することを学習します。

長いシーケンスに対する高密度のattentionメカニズムの計算コストを管理するために、OpenAIは以下の手法を採用しました:

  • Low Resolution: 訓練は32x32、48x48、および64x64の解像度で行われました。
  • Custom Color Palette: ピクセルを表すために9ビットのカラーパレットが作成され、色の忠実度を維持しながら、標準的なRGBパレットと比較して入力シーケンスの長さを3分の1に削減しました。
  • Model Scales: 4つのバージョンが訓練されました:iGPT-S (76M parameters), iGPT-M (455M), iGPT-L (1.4B), and iGPT-XL (6.8B)。

Correlation Between Generation and Classification

この研究は、モデルの生成性能と画像分類能力の間に直接的な関連性があることを確立しています。OpenAIは、モデルのスケールが増大し、訓練の反復が継続するにつれて、生成の質が向上し、それがダウンストリームタスクにおけるより高い特徴量の質へと直接的に変換されることを見出しました。

Feature Extraction and Depth

特徴量の質はネットワーク全体で均一ではありません。OpenAIは、画像分類に最適な特徴量は最終層ではなく、ネットワークの中間層に存在することを確認しました。これは、以下の2段階の動作を示唆しています:

  1. Contextualization: モデルは周囲のピクセルから情報を収集し、文脈化された画像特徴を構築します。
  2. Prediction: モデルはその特徴を使用して、条件付きの次ピクセル予測タスクを解決します。

Experimental Results and Benchmarks

iGPTは、複数のデータセットに対して、linear probe(学習された特徴量に対するロジスティック回帰)およびフルファインチューニングを用いて評価されました。

Unsupervised Performance

いくつかのデータセットにおいて、iGPT-L (32x32) は、linear probeを用いた他の教師なし転移学習アルゴリズムを上回りました:

  • CIFAR-10: 96.3% accuracy (compared to 95.3% for SimCLR).
  • CIFAR-100: 82.8% accuracy (compared to 80.2% for SimCLR).
  • STL-10: 95.5% accuracy (compared to 94.2% for AMDIM).

ImageNetにおいて、iGPT-XL (64x64) は、5つの層から抽出された15,360個の特徴量を用いて72.0%のtop-1 accuracyを達成し、AMDIM, MoCo, and CPC v2を上回りましたが、SimCLRの76.5%には及びませんでした。

Comparison with BERT-style Pre-training

OpenAIは、BERTと同様のアプローチ(ピクセルの15%をマスク)をテストしました。BERTスタイルのモデルは、linear probeにおいて著しく低い性能を示しましたが、フルファインチューニングにおいては生成モデルと競争できる性能を示しました。

Semi-Supervised Learning

非拡張画像に対する単純なlinear probeを用いることで、iGPT-Lは、データ量の少ないCIFAR-10においてMean TeacherやMixMatchを上回りましたが、FixMatchには及びませんでした。

Limitations and Computational Costs

その性能にもかかわらず、iGPTにはドメイン固有の事前知識の欠缺乏 due to its lack of domain-specific priors:

  • Compute Intensity: iGPT-Lの訓練には約2,500 V100-daysの訓練が必要でしたが、一方で、同等の性能を持つMoCoモデルは、約70 V100-daysを必要とします。
  • Resolution Constraints: 畳み込みエンコーダではなくtransformerを使用しているため、iGPTは低解像度入力に制限されています。より高い解像度へのスケーリングは、multiscale transformerのような新しいアーキテクチャが必要になる可能性があります。
  • Algorithmic Bias: 生成モデルとして、iGPTは訓練データに含まれるバイアスを継承し、増幅させる可能性があり、それが不公平または非代表的な画像補完を生成する可能性があります。

Conclusion

iGPTは、大規模なシーケンスtransformerが、手動でコード化されたアーキテクチャの知識なしに、新しいドメインにおいて優れた教師なし表現を学習できることの概念実証(proof-of-concept)として機能します。2次元の空間的事前知識を計算スケールと交換することで、iGPTは、GPTアーキテクチャの単純さと汎用性が、言語から視覚へと効果的に拡張できることを示しています。

Sources