AMD EPYC Turin CPU 在 Genoa 之上提供 2× LLM 推理吞吐量
TL;DR
AMD 第五代 EPYC CPU,代號為 Turin,在大型語言模型工作負載下,提供大約是前一代 Genoa 晶片兩倍的推理吞吐量,得益於最高 192 核心、384 執行緒,以及 ZenDNN 加速的 torch.compile 路徑。
AMD Turin 是什麼?
AMD 宣佈了基於 Zen 5 架構的第五代伺服器級 EPYC 處理器,市場名稱為 Turin。此晶片可擴展至 192 個實體核心 與 384 個硬體執行緒,相較於先前的 96 核心 Genoa 系列,提供了顯著提升的平行計算能力。
為何 Turin 對 Hugging Face 使用者重要
- 降低延遲 – 更多核心與 ZenDNN 最佳化的 PyTorch 插件 (
zentorch) 可減少產生每個 token 的時間。 - 提升吞吐量 – 在所有核心上平行執行多個模型實例,使每秒解碼的 token 數量提升至最高 2 倍。
- 成本效益 – 更快的推理意味著相同工作負載所需的伺服器數量減少,從而降低營運成本。
基準測試方法論
Hugging Face 團隊使用 ZenDNN 5.0 的 PyTorch 插件驗證 EPYC Turin 平台,該插件與 torch.compile 整合以套用圖層級最佳化。基準測試在 bfloat16 精度下執行,採用多實例設定,將 每個插槽 32 個實體核心 分配給 Meta LLaMA 3.1 8B‑Instruct 模型的每個實例。測試了兩種批次大小(16 與 32),涵蓋五項具代表性的 LLM 任務:
- 摘要 (1024 → 128 tokens)
- 聊天機器人 (128 → 128 tokens)
- 翻譯 (1024 → 1024 tokens)
- 論文寫作 (128 → 1024 tokens)
- 即時字幕 (16 → 16 tokens)
吞吐量以每秒解碼的 token 數量衡量,排除第一個 token,以聚焦於穩定狀態的效能。
結果:Turin 與 Genoa 比較

圖表顯示 Turin 持續優於 Genoa,在大多數批次大小與使用情境下達到 約 2 倍更高的吞吐量。此提升歸因於更高的核心數量以及 ZenDNN 加速的 torch.compile 管線所帶來的效率增益。
可重現性工具
- optimum‑benchmark – 使用 Hugging Face 的統一基準測試框架,搭配
zentorch後端來編排測試。 - Dockerfile(即將推出) – 將發布包含基準測試程式碼與相依性的最佳化 Docker 映像,簡化結果的重現。
開始使用 ZenDNN
開發者可透過以下開源插件,體驗 AMD Zen 深度神經網路(ZenDNN)生態系統:
- ZenTF – TensorFlow 整合:
https://github.com/amd/ZenDNN-tensorflow-plugin - ZenTorch – PyTorch 整合(在基準測試中使用):
https://github.com/amd/ZenDNN-pytorch-plugin - ZenDNN ONNXRuntime – ONNX Runtime 支援:
https://github.com/amd/ZenDNN-onnxruntime
欲了解更多資訊,請造訪官方 AMD ZenDNN 頁面:https://www.amd.com/en/developer/zendnn.html。
結論
AMD 的 EPYC Turin CPU 為 LLM 推理相較於 Genoa 代提供了 顯著的效能提升,使 Hugging Face 使用者能夠實現更低的延遲、更高的吞吐量與降低成本。ZenDNN 加速的 torch.compile 與即將推出的 Docker 部署套件的結合,使社群能輕鬆採用並基準測試這一新硬體世代。