OpenAI Sparse Transformer

OpenAIは、テキスト、画像、音声のシーケンスにおける次の要素を予測するように設計された深層ニューラルネットワークであるSparse Transformerを開発しました。アテンション・メカニズムへのアルゴリズム的な改善を実装することで、このモデルは以前よりも30倍長いシーケンスからパターンを抽出することができ、数百のレイヤーを使用して数万の要素をモデリングすることが可能になります。

Reducing Memory Constraints with Deep Attention

標準的なTransformerアーキテクチャは、すべてのレイヤーとアテンション・ヘッドに対して $N \times N$ のアテンション行列を必要とします。これは、生の音声や大きな画像のような高次元データを処理する際に、重大なメモリのボトルネックを生み出します。例えば、64x64x3ピクセルのImageNet画像は、深いTransformer(64レイヤー、4ヘッド)において、行列を保存するために154 GBのメモリを必要とし、標準的なGPUの12-32 GBの容量を大幅に超えています。

Sparse Attention and Algorithmic Complexity

単一のアテンション行列ですら実用的でない非常に大きな入力を扱うために、Sparse Transformerはスパース・アテンション・パターンを利用します。このアプローチでは、各出力位置は入力位置のサブセット(例えば、 $N$ の代わりに $\sqrt{N}$ の要素)からのみ重み付けを計算します。これにより、アルゴリズムの計算複雑度が $O(N^2)$ から $O(N \sqrt{N})$ に減少します。

Factorized Attention Patterns

モデルが動的でグローバルなパターンを学習する能力を維持できるように、OpenAIはアテンション行列の二次元的な因数分解を実装しました。これにより、ネットワークは2段階のスパー・アテンションを通じてすべての位置に注目することができます:

  • Strided Attention: 各位置は自身の行と列に注目し、フル・アテンション操作を効果的に因数分解します。これは、画像のような二次元構造を持つデータに特に有用です。
  • Fixed Attention: ネットワークは固定された列と、最新の列要素に続く要素に注目します。このパターンは、テキストのような二次元構造に適合しないデータに最適化されています。

Experimental Results and Performance

Sparse Transformerは、以下のベンチマーク・データセットにおける密度推定において、新しいSOTA(State-of-the-art)スコアを達成しました:

  • CIFAR-10
  • Enwik8
  • Imagenet 64

OpenAIは、スパース・アテンションがフル・アテンションよりも高速に動作するだけでなく、より低い損失(loss)を達成することも観察しました。研究者たちは、これが密なアテンションにおける潜在的な最適化の問題、あるいはスパースなパターンによって提供される有益な帰納バイアス(inductive bias)によるものである可能性があると示唆しています。

Generative Capabilities across Modalities

Image Generation

このモデルは、64x64 ImageNetデータを用いた画像補完タスクを通じて、グローバルな構造の把握能力を示しています。モデルは最尤推定(maximum likelihood)の目的関数を使用して学習されているため、調整されていないsoftmax温度が1.0の状態で生成された無条件サンプルは、モデルが実在すると信じている画像の完全な分布を反映しており、それが時として奇妙な見た目のサンプルを生み出すことがあります。

Raw Audio Generation

位置エンコーディング(position embeddings)を修正することで、Sparse Transformerは生の音声波形を生成することができます。OpenAIは、生のクラシック音楽のクリップを用いてモデルを学習させ、65,000要素のシーケンス(約5秒間の生の音声に相当)を生成することを可能にしました。

Implementation and Limitations

スパース・アテンションの使用を容易にするため、OpenAIは、クエリ(query)とキー(key)行列の必要なスライシングを効率的に実行する一連のブロック・スパースGPUカーネルをオープンソース化しました。

これらの進歩にもかかわらず、研究者たちは、自己回帰的なシーケンス生成が、非常に高解像度の画像やビデオにおいては依然として実用的ではないと指摘しています。彼らは、これらの最適化されたアテンション操作が、将来的にマルチスケール・モデリング・アプローチのプリミティブとして機能する可能性があると示唆しています。

Sources