Habana Gaudi2 vs Nvidia A100 80GB パフォーマンスベンチマーク

Habana Gaudi2 は、トレーニングと推論の両タスクにおいて、Nvidia A100 80GB のスループットの約2倍を実現します。この性能向上は、メモリ容量の増加と 🤗 Optimum Habana ライブラリとのシームレスな統合によって支えられています。

ハードウェア仕様と互換性

Gaudi2 は Habana Labs の第2世代 AI ハードウェアアクセラレータです。1 台のサーバーには通常 8 台のアクセラレータデバイスが搭載され、各デバイスは 96GB のメモリを備えています。これは Nvidia A100 80GB の 80GB や第1世代 Gaudi の 32GB に比べて大幅に増加しています。

Habana SDK の SynapseAI は第1世代 Gaudi と Gaudi2 の両方で共通であるため、🤗 Optimum Habana インターフェースは両ハードウェア世代で同一です。第1世代 Gaudi 用に設計されたワークフローは、コード変更なしで Gaudi2 と互換性があります。

トレーニング性能:BERT 事前学習

Gaudi2 は第1世代 Gaudi と Nvidia A100 80GB の両方に比べ、BERT 事前学習で大幅なスピードアップを示します。デバイスあたり 32 サンプルのバッチサイズを使用した場合、Gaudi2 は 1580.2 サンプル/秒のスループットを達成し、A100 は 981.6 サンプル/秒でした。

BERT 事前学習から得られた主な結果は次のとおりです:

  • Speedup over First-gen Gaudi: Gaudi2 はバッチサイズ 32 で 3.04 倍のスピードアップを達成しました。バッチサイズを 64 に増やすことで(Gaudi2 の大容量メモリを活用)、総トレーニング時間が 5.75 倍短縮され、スループットは 1835.8 サンプル/秒に増加しました(第1世代 Gaudi に対して 3.53 倍の向上)。
  • Speedup over Nvidia A100: Gaudi2 はテストした両バッチサイズ(32 と 64)で A100 を上回り、BERT 事前学習第1フェーズで Habana が発表した 1.8 倍のスピードアップと一致するスループット優位性を維持しました。
ハードウェア バッチサイズ(デバイスあたり) スループット(サンプル/秒) 第1世代 Gaudi に対するスピードアップ
First-gen Gaudi 32 520.2 x1.0
Gaudi2 32 1580.2 x3.04
Gaudi2 64 1835.8 x3.53
A100 32 981.6 x1.89
A100 64 1082.6 x2.08

推論性能:Stable Diffusion

Gaudi2 は Stable Diffusion を用いた画像生成のレイテンシを大幅に削減します。バッチサイズ 8 サンプルの場合、Gaudi2 は画像あたり 0.925 秒のレイテンシを達成し、Nvidia A100(画像あたり 2.63 秒)より 2.84 倍速く、第一世代 Gaudi(画像あたり 3.25 秒)より 3.51 倍速くなります。

これらのベンチマークは Habana/stable-diffusion 設定と 🤗 Optimum Habana 1.3 リリースを使用して実施され、Stable Diffusion の公式サポートが導入されました。精度を確保するため、モデルコンパイル時間を考慮して最初の 2 バッチは破棄されました。

大規模モデルファインチューニング:T5-3B

Gaudi2 のデバイスあたり 96GB のメモリにより、第一世代 Gaudi では実行不可能だった大規模モデルのファインチューニングが可能になります。要約タスク用に CNN DailyMail データセットでファインチューニングした T5-3B モデル(30 億パラメータ)を用いたテストで、Gaudi2 は Nvidia A100 80GB を上回りました。

Gaudi2 はスループット 19.7 サンプル/秒を達成し、A100 の 8.07 サンプル/秒に比べて 2.44 倍のスピードアップとなります。これらの実行は 8 台のデバイスで fp32 と勾配チェックポイントを有効にして行われました。レポートでは、将来の SynapseAI リリースでメモリフットプリントの最適化が行われることで、これらの結果がさらに向上することが期待されると述べられています。

パフォーマンス向上のまとめ

テストしたすべてのワークロードにおいて、Gaudi2 は Nvidia A100 80GB より一貫して高いスループットと低いレイテンシを提供します:

  • BERT 事前学習:A100 に対して最大 2.08 倍のスループット向上。
  • Stable Diffusion 推論:A100 に対して 2.84 倍のレイテンシ低減。
  • T5-3B ファインチューニング:A100 に対して 2.44 倍のスループット向上。

Sources