Anthropic Research: Scaling Laws and Interpretability of Learning from Repeated Data

Anthropicの研究によれば、トレーニングデータのわずかな一部を繰り返すことで、大規模言語モデル(LLM)の性能が不釣り合いに大きく低下することが明らかになりました。これは主に、モデルが汎化から記憶へとシフトするためです。この影響は、予測可能な範囲の繰り返し頻度が、モデルの容量の大部分を繰り返されたデータの記憶に費やさせ、実質的にモデルの機能的な容量を減少させる場合に最も深刻になります。

Performance Degradation and the Double Descent Phenomenon

繰り返されたデータでLLMをトレーニングすると、トレーニングの途中でテスト損失が大幅に増加する現象が発生することがあり、これは「二重降下(double descent)」として知られる現象です。この性能低下は線形ではなく、性能が最も深刻に損なわれる特定の繰り返し頻度の範囲が存在します。

例えば、トレーニングトークンの残りの90%がユニークであるにもかかわらず、トレーニングデータのわずか0.1%を100回繰り返した場合、800Mパラメータのモデルの性能が400Mパラメータのモデルと同程度まで低下することがあります。これは、比較的少量のデータを繰り返すことが、モデルの全体的な能力に過大な負の影響を与える可能性があることを示しています。

The Mechanism of Memorization vs. Generalization

Anthropicの研究者は、性能低下のピークは、モデルが繰り返されたデータを正常に記憶できる範囲に入ったときに発生すると仮説を立てています。モデルがこれらの記憶されたシーケンスを保存するために容量の大部分を割り当てると、データセットの残りの部分に対して汎化する能力を失います。

この汎化から記憶へのシフトは、モデルが行う詳細な計算と結びついています。この研究は、これらの観察結果をメカニズム的な解釈可能性(mechanistic interpretability)に結びつけ、データの繰り返しが、汎化に関連する内部構造、具体的には copying と induction heads に不釣り合いなほど大きなダメージを与えると示しています。

Implications for Data Deduplication

この知見は、データ重複排除(data deduplication)がLLMのトレーニングにおいて極めて重要であることを示唆しています。繰り返されたデータが意図的に(高品質なデータを重視するため)繰り返されているのか、あるいは意図せず(文、段落、またはドキュメントレベルでの不完全な重複排除のため)繰り返されているのかに関わらず、汎化よりも記憶に偏るリスクは、モデルの性能にとって高いリスクとなります。この研究は、なぜモデルの容量が記憶によって消費され、モデルの汎用的な知能に必要な内部構造を損なうのかについて、メカニズム的な説明を提供しています。

Sources

関連