Habana Gaudi2 vs Nvidia A100 80GB 性能基准
Habana Gaudi2 在训练和推理任务中提供约两倍于 Nvidia A100 80GB 的吞吐量。该性能提升得益于更大的内存容量以及与 🤗 Optimum Habana 库的无缝集成。
硬件规格与兼容性
Gaudi2 是 Habana Labs 的第二代 AI 硬件加速器。单台服务器通常配备八个加速器设备,每个设备拥有 96GB 内存。这相比 Nvidia A100 80GB 的 80GB 以及第一代 Gaudi 的 32GB 有了显著提升。由于 Habana SDK SynapseAI 在第一代 Gaudi 和 Gaudi2 中通用,🤗 Optimum Habana 接口在两个硬件代际保持一致。为第一代 Gaudi 设计的工作流在 Gaudi2 上无需代码更改即可兼容。
训练性能:BERT 预训练
与第一代 Gaudi 和 Nvidia A100 80GB 相比,Gaudi2 在 BERT 预训练中展示了显著的加速。当每个设备使用 32 样本的批量大小时,Gaudi2 实现了 1580.2 样本/秒的吞吐量,而 A100 为 981.6 样本/秒。
关键发现包括:
- 相较于第一代 Gaudi 的加速:Gaudi2 在批量大小为 32 时实现了 3.04 倍的加速。通过将批量大小提升至 64(利用 Gaudi2 更大的内存),总训练时间缩短了 5.75 倍,吞吐量提升至 1835.8 样本/秒(相较于第一代 Gaudi 提升了 3.53 倍)。
- 相较于 Nvidia A100 的加速:Gaudi2 在两种测试批量大小(32 和 64)下均优于 A100,保持了与 Habana 宣布的 BERT 预训练第一阶段 1.8 倍加速相一致的吞吐量优势。
| 硬件 | 批量大小(每设备) | 吞吐量(样本/秒) | 相较于第一代 Gaudi 的加速 |
|---|---|---|---|
| First-gen Gaudi | 32 | 520.2 | x1.0 |
| Gaudi2 | 32 | 1580.2 | x3.04 |
| Gaudi2 | 64 | 1835.8 | x3.53 |
| A100 | 32 | 981.6 | x1.89 |
| A100 | 64 | 1082.6 | x2.08 |
推理性能:Stable Diffusion
Gaudi2 大幅降低了使用 Stable Diffusion 进行图像生成的延迟。批量大小为 8 样本时,Gaudi2 实现了每张图像 0.925 秒的延迟,比 Nvidia A100(每张图像 2.63 秒)快 2.84 倍,也比第一代 Gaudi(每张图像 3.25 秒)快 3.51 倍。这些基准测试使用 Habana/stable-diffusion 配置和 🤗 Optimum Habana 1.3 版本进行,该版本引入了对 Stable Diffusion 的官方支持。为确保准确性,前两个批次被丢弃,以考虑模型编译时间。
大模型微调:T5-3B
Gaudi2 每设备 96GB 的内存使得可以微调在第一代 Gaudi 上无法运行的更大模型。在对 T5-3B 模型(30 亿参数)进行 CNN DailyMail 数据集摘要微调的测试中,Gaudi2 超越了 Nvidia A100 80GB。Gaudi2 实现了 19.7 样本/秒的吞吐量,而 A100 为 8.07 样本/秒,提升了 2.44 倍。这些运行在八个设备上以 fp32 精度并启用梯度检查点进行。报告指出,未来 SynapseAI 版本的内存占用优化有望进一步提升这些结果。
性能提升汇总
在所有测试工作负载中,Gaudi2 始终提供比 Nvidia A100 80GB 更高的吞吐量和更低的延迟:
- BERT 预训练:吞吐量最高比 A100 高出 2.08 倍。
- Stable Diffusion 推理:延迟比 A100 低 2.84 倍。
- T5-3B 微调:吞吐量比 A100 高出 2.44 倍。