大規模言語モデル:新たなムーアの法則か?

大規模言語モデル(LLM)のサイズが指数関数的に増大している傾向は、収益の減少、法外なコスト、そして重大な環境への影響を招いています。Megatron-Turing NLG 530Bのような巨大なモデルはエンジニアリングの技術力を示していますが、数兆パラメータのモデルへと向かう道は、現実世界のビジネスアプリケーションにとっては非実用的であり、地球にとっても持続不可能であることが多いです。

メガモデルのスケーリングに伴うコスト

モデルを数千億のパラメータにまでスケールアップさせることは、極端な財務的および環境的な参入障壁を生み出します。「メガモデル」の追求は、アルゴリズムの効率性よりも力任せのエンジニアリングに依存しています。

財務的な非現実性

Megatron-Turing NLG 530B規模のモデルをトレーニングするには、膨大なインフラストラクチャが必要です。1台あたり約199,000ドルかかる数百台のDGX A100マルチGPUサーバーを使用し、ネットワークやホスティングのコストを加えると、このような実験を再現するには1億ドル近いコストがかかる可能性があります。これほどの投資を正当化できるビジネスユースケースを持つ組織は、ごくわずかです。

環境への影響

GPUでディープラーニングモデルをトレーニングすることは、エネルギー集約型です。単一のDGXサーバーは最大6.5キロワットを消費する可能性があります。これらのモデルのカーボンフットプリントは相当なものです。参考として、2019年のマサチューセッツ大学の研究では、GPUでBERTをトレーニングすることは、アメリカ大陸横断飛行にほぼ相当すると指摘されています。BERT-Largeはわずか3億4,000万パラメータしか持たないため、5,000億パラメータの範囲のモデルではさらに巨大なフットプリントが生じることを示唆しています。

巨大モデルに代わる実用的な代替案

モデルのサイズを追い求める代わりに、開発者は高品質な機械学習ソリューションを構築するための、効率的で実行可能な技術に焦点を当てるべきです。

学習済みモデルと小型モデルの活用

ほとんどのユースケースにおいて、カスタムモデルのアーキテクチャは必要ありません。最も効率的なワークフローは、特定のタスク(例:テキスト要約)に適した学習済みモデルを特定し、ターゲットデータでテストすることです。精度が不十分な場合は、モデルをファインチューニングすべきです。

さらに、実務者は、より高速な予測とハードウェアのオーバーヘッドを低減するために、精度の要件を満たす最小のモデルを選択すべきです。効率性を重視した研究の例は以下の通りです:

  • SqueezeNet: AlexNetと比較して精度を維持または上回る一方で、サイズを50倍削減することに成功しました。
  • DistilBERT: BERTの言語理解能力の97%を維持しながら、サイズを40%小さく、速度を60%高速化しました。
  • T0 (Big Science project): 多くのタスクにおいてGPT-3を凌駕する一方で、サイズは16倍小さくなっています。

ファインチューニング vs. スクラッチからのトレーニング

特定のデータセットに対して数エポック、学習済みモデルをファインチューニングすることは、スクラッチからトレーニングするよりも大幅に効率的です。この転移学習のアプローチは、膨大なデータの収集の必要性を減らし、イテレーションサイクルを加速させ、本番環境のリソース要件を低減します。

インフラストラクチャと最適化戦略

効率性と持続可能性を最大化するために、組織は最適化されたインフラストラクチャと専門的なソフトウェアツールを利用すべきです。

クラウドベースのインフラストラクチャ

クラウドベースのインフラストラクチャは、一般的にオンプレミスのアナログと比較して、エネルギーおよびカーボン効率が高いです。AWS、Azure、Google Cloudなどのプロバイダーは、Amazon SageMakerのようなマネージドサービスを提供しており、柔軟性と従量課金モデルを提供することで、ハードウェアの未利用分による無駄を削減します。

モデルの最適化技術

モデルのサイズと速度を最適化するには、いくつかの複雑な技術的戦略が含まれます:

  • Specialized Hardware: Graphcore、Habana、Google TPU、またはAWS Inferentiaを利用して、トレーニングと推論の速度を向上させます。
  • Pruning: 予測結果にほとんど、あるいは全く影響を与えないモデルパラメータを削除します。
  • Fusion: 畳み込み層と活性化層を組み合わせるなど、モデルの層を統合します。
  • Quantization: モデルパラメータをより小さな値(例:32ビットではなく8ビット)で保存します。

Optimumライブラリや、1ミリ秒のレイテンシを実現するコンテナ化ソリューションであるInfinityのようなツールは、これらの最適化プロセスを自動化するために設計されています。

Sources

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch
  • Dispatch