AMD EPYC Turin CPU가 Genoa 대비 2배 LLM 추론 처리량을 제공

TL;DR

AMD의 5세대 EPYC CPU인 Turin은 최대 192코어, 384스레드, 그리고 ZenDNN 가속 torch.compile 경로 덕분에 대규모 언어 모델 워크로드에서 이전 세대인 Genoa 칩에 비해 추론 처리량을 대략 두 배로 제공합니다.

AMD Turin이란?

AMD는 Zen 5 아키텍처 기반의 다섯 번째 세대 서버급 EPYC 프로세서인 Turin을 발표했습니다. 이 칩은 192개의 물리 코어384개의 하드웨어 스레드까지 확장되며, 이전의 96코어 Genoa 라인에 비해 병렬 연산 능력이 크게 증가합니다.

왜 Turin이 Hugging Face 사용자에게 중요한가

  • 낮은 지연 시간 – 더 많은 코어와 ZenDNN 최적화 PyTorch 플러그인(zentorch)이 각 토큰 생성 시간을 줄입니다.
  • 높은 처리량 – 모든 코어에서 다중 모델 인스턴스를 병렬 실행함으로써 초당 디코딩된 토큰 수가 최대 2배 증가합니다.
  • 비용 효율성 – 빠른 추론은 주어진 워크로드에 필요한 서버 수를 줄여 운영 비용을 낮춥니다.

벤치마크 방법론

Hugging Face 팀은 ZenDNN 5.0 PyTorch 플러그인을 사용하여 EPYC Turin 플랫폼을 검증했으며, 이 플러그인은 torch.compile과 통합되어 그래프 수준 최적화를 적용합니다. 벤치마크는 bfloat16 정밀도로 다중 인스턴스 설정에서 수행되었으며, 각 Meta LLaMA 3.1 8B‑Instruct 모델 인스턴스에 소켓당 32개의 물리 코어가 할당되었습니다. 두 가지 배치 크기(16 및 32)를 사용해 다섯 가지 대표적인 LLM 작업을 테스트했습니다:

  • 요약 (1024 → 128 토큰)
  • 챗봇 (128 → 128 토큰)
  • 번역 (1024 → 1024 토큰)
  • 에세이 작성 (128 → 1024 토큰)
  • 실시간 캡션 (16 → 16 토큰)

처리량은 초당 디코딩된 토큰 수로 측정했으며, 첫 번째 토큰은 제외하고 정상 상태 성능에 초점을 맞추었습니다.

결과: Turin vs. Genoa

처리량 비교

이 차트는 Turin이 지속적으로 Genoa보다 우수함을 보여주며, 대부분의 배치 크기와 사용 사례에서 대략 2배 높은 처리량을 달성합니다. 이러한 개선은 코어 수 증가와 ZenDNN 가속 torch.compile 파이프라인에서 얻은 효율성 향상 덕분입니다.

재현성 도구

  • optimum‑benchmark – Hugging Face의 통합 벤치마킹 프레임워크를 사용하여 zentorch 백엔드로 테스트를 조정했습니다.
  • Dockerfile (forthcoming) – 벤치마크 코드와 종속성을 포함한 최적화된 Docker 이미지가 곧 출시되어 결과 재현을 간소화합니다.

ZenDNN 시작하기

개발자는 다음 오픈소스 플러그인을 통해 AMD Zen Deep Neural Network (ZenDNN) 생태계를 실험할 수 있습니다:

  • ZenTF – TensorFlow 통합: https://github.com/amd/ZenDNN-tensorflow-plugin
  • ZenTorch – PyTorch 통합 (벤치마크에 사용됨): https://github.com/amd/ZenDNN-pytorch-plugin
  • ZenDNN ONNXRuntime – ONNX Runtime 지원: https://github.com/amd/ZenDNN-onnxruntime

자세한 내용은 공식 AMD ZenDNN 페이지를 방문하세요: https://www.amd.com/en/developer/zendnn.html.

결론

AMD의 EPYC Turin CPU는 Genoa 세대에 비해 LLM 추론에서 큰 성능 향상을 제공하며, Hugging Face 사용자가 낮은 지연 시간, 높은 처리량 및 비용 절감을 달성하도록 합니다. ZenDNN 가속 torch.compile와 곧 출시될 Docker 배포 패키지의 결합으로 커뮤니티가 이 새로운 하드웨어 세대를 쉽게 채택하고 벤치마크할 수 있습니다.

Sources