Habana Gaudi2 vs Nvidia A100 80GB 성능 벤치마크

Habana Gaudi2는 학습 및 추론 작업 모두에서 Nvidia A100 80GB 대비 약 두 배의 처리량을 제공합니다. 이러한 성능 향상은 메모리 용량 증가와 🤗 Optimum Habana 라이브러리와의 원활한 통합으로 뒷받침됩니다.

하드웨어 사양 및 호환성

Gaudi2는 Habana Labs의 2세대 AI 하드웨어 가속기입니다. 일반적인 단일 서버에는 8개의 가속기 장치가 탑재되어 있으며, 각 장치는 96GB 메모리를 갖추고 있습니다. 이는 Nvidia A100 80GB의 80GB 및 1세대 Gaudi의 32GB에 비해 크게 증가한 용량입니다.

Because the Habana SDK, SynapseAI, is common to both first-generation Gaudi and Gaudi2, the 🤗 Optimum Habana interface remains identical for both hardware generations. Workflows designed for first-gen Gaudi are compatible with Gaudi2 without requiring code changes.

학습 성능: BERT 사전 학습

Gaudi2는 1세대 Gaudi와 Nvidia A100 80GB에 비해 BERT 사전 학습에서 상당한 속도 향상을 보여줍니다. 장치당 배치 크기 32 샘플을 사용할 경우 Gaudi2는 초당 1580.2 샘플의 처리량을 달성했으며, A100은 981.6 샘플에 그쳤습니다.

  • 첫 번째 세대 Gaudi 대비 속도 향상: Gaudi2는 배치 크기 32에서 3.04배의 속도 향상을 달성했습니다. 배치 크기를 64로 늘리면(Gaudi2의 더 큰 메모리를 활용) 전체 학습 시간이 5.75배 감소하고 처리량은 1835.8 샘플/초로 증가했으며(1세대 Gaudi 대비 3.53배 증가).
  • Nvidia A100 대비 속도 향상: Gaudi2는 테스트한 두 배치 크기(32 및 64) 모두에서 A100보다 우수한 성능을 보였으며, 이는 BERT 사전 학습 1단계에 대해 Habana가 발표한 1.8배 속도 향상과 일치합니다.
하드웨어 배치 크기 (장치당) 처리량 (샘플/초) 첫 번째 세대 Gaudi 대비 속도 향상
1세대 Gaudi 32 520.2 x1.0
Gaudi2 32 1580.2 x3.04
Gaudi2 64 1835.8 x3.53
A100 32 981.6 x1.89
A100 64 1082.6 x2.08

추론 성능: Stable Diffusion

Gaudi2는 Stable Diffusion을 이용한 이미지 생성에서 지연 시간을 크게 줄입니다. 배치 크기 8 샘플일 때 Gaudi2는 이미지당 0.925초의 지연 시간을 기록했으며, 이는 Nvidia A100(이미지당 2.63초)보다 2.84배, 1세대 Gaudi(이미지당 3.25초)보다 3.51배 빠른 결과입니다.

These benchmarks were conducted using the Habana/stable-diffusion configuration and the 🤗 Optimum Habana 1.3 release, which introduced official support for Stable Diffusion. To ensure accuracy, the first two batches were discarded to account for model compilation times.

대형 모델 파인튜닝: T5-3B

Gaudi2의 장치당 96GB 메모리는 1세대 Gaudi에서는 실행할 수 없었던 대형 모델 파인튜닝을 가능하게 합니다. 요약 작업을 위해 CNN DailyMail 데이터셋으로 파인튜닝한 T5-3B 모델(30억 파라미터) 테스트에서 Gaudi2는 Nvidia A100 80GB보다 우수한 성능을 보였습니다.

Gaudi2는 초당 19.7 샘플의 처리량을 달성했으며, A100의 8.07 샘플/초에 비해 2.44배의 속도 향상을 나타냈습니다. 이 실험은 8대 장치에서 fp32와 그래디언트 체크포인팅을 활성화한 상태로 수행되었습니다. 보고서에 따르면 향후 SynapseAI 릴리스에서 메모리 사용량 최적화가 이루어지면 결과가 더욱 개선될 것으로 기대됩니다.

성능 향상 요약

테스트한 모든 워크로드에서 Gaudi2는 Nvidia A100 80GB보다 일관되게 높은 처리량과 낮은 지연 시간을 제공합니다:

  • BERT 사전 학습: A100 대비 최대 2.08배 높은 처리량.
  • Stable Diffusion 추론: A100 대비 2.84배 낮은 지연 시간.
  • T5-3B 파인튜닝: A100 대비 2.44배 높은 처리량.

Sources