Llama 2 on Amazon SageMaker ベンチマーク
Hugging Face は、Amazon SageMaker 上の Llama 2 の 60 種類以上のデプロイ構成を分析する包括的なベンチマークをリリースしました。この分析は、コスト効率、最大スループット、最小レイテンシのいずれを優先するかに基づいて、組織が生成 AI デプロイメントを最適化するためのデータドリブンな推奨事項を提供します。
デプロイ インフラストラクチャと方法論
このベンチマークは、Text Generation Inference (TGI) によって駆動される Hugging Face LLM Inference コンテナを利用しています。TGI は、ダイナミック バッチングとテンソル パラレルism を通じて高性能なテキスト生成を可能にするオープンソース ソリューションです。
ベンチマーク パラメータ
To evaluate real-world performance, Hugging Face tested three Llama 2 model sizes (7B, 13B, and 70B parameters) across the following variables:
- インスタンスタイプ: NVIDIA A10G GPU (g5.2xlarge, g5.12xlarge, g5.48xlarge) および NVIDIA A100 40GB GPU (p4d.24xlarge).
- ロードレベル: 同時リクエスト数 1, 5, 10, 20.
- 量子化: 標準の重みと GPTQ 4-bit 量子化を使用してパフォーマンスを比較しました。GPTQ はモデルの重みを 32 ビットから 3-4 ビットに削減し、メモリ要件を大幅に低減し、より大きなモデル(例えば Llama 2 13B)が単一の GPU で実行できるようにします。
パフォーマンス メトリクス
パフォーマンスは以下の 2 つの主要な指標で測定されました。
- スループット: 1 秒あたりに生成されるトークン数。
- レイテンシ: 1 トークンを生成するために必要な時間(ミリ秒/トークンで測定)。
最適なデプロイメントの推奨事項
ベンチマーク結果に基づき、Hugging Face はビジネス目的に応じた 3 つの主要なデプロイメント戦略を特定しました。
最もコスト効率の良いデプロイメント
トークンあたりのコストを最小化したいユーザーにとって、GPTQ 量子化が最も効果的な戦略です。これにより、単一の GPU インスタンスで Llama 2 13B をデプロイすることが可能になります。
| モデル | 量子化 | インスタンス | 同時リクエスト数 | レイテンシ (ms/token) | スループット (tokens/sec) | コスト ($/h) | 100 万トークンあたりのコスト | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | Llama 2 7B | GPTQ | g5.2xlarge | 5 | 34.25 | 120.09 | $1.52 | $3.50 | | Llama 2 13B | GPTQ | g5.2xlarge | 5 | 56.24 | 71.71 | $1.52 | $5.87 | | Llama 2 70B | GPTQ | ml.g5.12xlarge | 5 | 138.35 | 33.33 | $7.09 | $59.08 |
スループット最大化デプロイメント
1 秒あたりに処理されるトークンの量を最大化するため、ハイエンドの GPU インスタンスと高い同時実行数が必要です。記録された最高の総合スループットは、ml.p4d.12xlarge インスタンスでの Llama 2 13B に対して 688 トークン/秒でした。
| モデル | 量子化 | インスタンス | 同時リクエスト数 | レイテンシ (ms/token) | スループット (tokens/sec) | コスト ($/h) | 100 万トークンあたりのコスト | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | Llama 2 7B | None | ml.g5.12xlarge | 20 | 44.00 | 449.94 | $7.09 | $3.97 | | Llama 2 13B | None | ml.p4d.12xlarge | 20 | 67.40 | 668.02 | $37.69 | $15.67 | | Llama 2 70B | None | ml.p4d.24xlarge | 20 | 59.80 | 321.54 | $37.69 | $32.56 |
レイテンシ最小化デプロイメント
チャット インターフェイスなどのリアルタイム アプリケーションでは、1 トークンを生成する時間を最小化することが重要です。最小のレイテンシは、ml.g5.12xlarge インスタンスでの Llama 2 7B によって達成されました。
| モデル | 量子化 | インスタンス | 同時リクエスト数 | レイテンシ (ms/token) | スループット (tokens/sec) | コスト ($/h) | 100 万トークンあたりのコスト | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | Llama 2 7B | None | ml.g5.12xlarge | 1 | 16.81 | 61.46 | $7.09 | $32.05 | | Llama 2 13B | None | ml.g5.12xlarge | 1 | 21.00 | 47.16 | $7.09 | $41.76 | | Llama 2 70B | None | ml.p4d.24xlarge | 1 | 41.35 | 24.51 | $37.69 | $427.05 |
結論
このベンチマークは、Amazon SageMaker 上の Llama 2 のデプロイ効率が、量子化とインスタンスタイプの選択に大きく依存していることを示しています。GPTQ 4-bit 量子化は、コスト効率の良いデプロイへの参入障壁を大幅に低減し、ハイパフォーマンスな NVIDIA A100 インスタンスはスループットの最大化に必要です。