OpenAI Scaling Laws for Neural Language Models

OpenAIは、ニューラル言語モデルの性能を支配する経験的なスケーリング則を特定しました。これらの法則は、クロスエントロピー損失が、モデルのパラメータ数、トレーニングデータセットのサイズ、およびトレーニングに使用される総計算量という3つの主要な変数に対して、べき乗則に従ってスケールすることを示しています。

Predictable Performance Scaling

クロスエントロピー損失によって測定される言語モデルの性能は、モデルのサイズ、データセットのサイズ、および計算量が増加するにつれて、予測可能な形で向上します。これらのべき乗則の傾向は、7桁以上の範囲にわたって一貫しています。

これらの性能の主要な要因は極めて重要ですが、特定のネットワークの幅や深さといった他のアーキテクチャの選択は、広範な構成内では性能に最小限の影響しか与えません。

Resource Allocation and Compute Efficiency

固定された計算予算の最適な配分を決定して性能を最大化するために、単純な方程式を使用できます。この最適化プロセスは、2つの主要な依存関係に基づいています:

  1. Overfitting: データセットに対するモデルのサイズとの間の過学習(Overfitting)の関係。
  2. Training Speed: トレーニング速度とモデルのサイズの間の関係。

Sample Efficiency in Large Models

より大きなモデルは、より小さなモデルよりも大幅にサンプル効率が高くなります。この効率性のため、最も計算効率の高いモデルのトレーニング方法は、比較的控えめな量のデータでトレーニングされた非常に大きなモデルを利用することです。最大限の効率を達成するためには、モデルが完全な収束に達するかなり前にトレーニングを停止する必要があります。

Sources