Habana Gaudi2 與 Nvidia A100 80GB 性能基準
硬體規格與相容性
Gaudi2 是 Habana Labs 的第二代 AI 硬體加速器。單一伺服器通常包含八個加速裝置,每個裝置配備 96GB 記憶體。這相較於 Nvidia A100 80GB 的 80GB 以及第一代 Gaudi 的 32GB 有顯著提升。
由於 Habana SDK SynapseAI 同時支援第一代 Gaudi 與 Gaudi2,🤗 Optimum Habana 介面在兩代硬體上保持一致。為第一代 Gaudi 設計的工作流程可直接在 Gaudi2 上使用,無需修改程式碼。
訓練效能:BERT 預訓練
相較於第一代 Gaudi 與 Nvidia A100 80GB,Gaudi2 在 BERT 預訓練上展現顯著加速。使用每個裝置 32 個樣本的批次大小時,Gaudi2 的吞吐量達到 1580.2 samples/s,而 A100 為 981.6 samples/s。
- 相較於第一代 Gaudi 的加速:Gaudi2 在批次大小 32 時達到 3.04 倍的加速。將批次大小提升至 64(利用 Gaudi2 更大的記憶體),總訓練時間縮短 5.75 倍,吞吐量提升至 1835.8 samples/s(相較於第一代 Gaudi 提升 3.53 倍)。
- 相較於 Nvidia A100 的加速:Gaudi2 在兩個測試批次大小(32 與 64)皆優於 A100,保持與 Habana 宣布的 BERT 預訓練第一階段 1.8 倍加速相符的吞吐量優勢。
| 硬體 | 批次大小(每個裝置) | 吞吐量(samples/s) | 相較於第一代 Gaudi 的加速 |
|---|---|---|---|
| 第一代 Gaudi | 32 | 520.2 | x1.0 |
| Gaudi2 | 32 | 1580.2 | x3.04 |
| Gaudi2 | 64 | 1835.8 | x3.53 |
| A100 | 32 | 981.6 | x1.89 |
| A100 | 64 | 1082.6 | x2.08 |
推論效能:Stable Diffusion
Gaudi2 大幅降低使用 Stable Diffusion 產生影像的延遲。批次大小為 8 個樣本時,Gaudi2 的每張影像延遲為 0.925 秒,比 Nvidia A100(每張影像 2.63 秒)快 2.84 倍,也比第一代 Gaudi(每張影像 3.25 秒)快 3.51 倍。
這些基準測試使用 Habana/stable-diffusion 配置與 🤗 Optimum Habana 1.3 版本進行,該版本正式支援 Stable Diffusion。為確保準確性,前兩個批次被捨棄,以考慮模型編譯時間。
大模型微調:T5-3B
Gaudi2 每個裝置的 96GB 記憶體使得微調在第一代 Gaudi 無法執行的更大型模型成為可能。在使用 T5-3B 模型(30 億參數)於 CNN DailyMail 資料集進行摘要微調的測試中,Gaudi2 超過了 Nvidia A100 80GB。
Gaudi2 的吞吐量為 19.7 samples/s,而 A100 為 8.07 samples/s,達到 2.44 倍的加速。此測試在 fp32 模式下,啟用梯度檢查點,於八個裝置上執行。報告指出,未來 SynapseAI 版本的記憶體占用優化預計將進一步提升此結果。
效能提升總結
在所有測試工作負載中,Gaudi2 始終提供比 Nvidia A100 80GB 更高的吞吐量與更低的延遲:
- BERT 預訓練:吞吐量最高比 A100 高出 2.08 倍。
- Stable Diffusion 推論:延遲比 A100 低 2.84 倍。
- T5-3B 微調:吞吐量比 A100 高出 2.44 倍。