Hugging Face 與 AMD 為 LLMs 提供 GPU 加速

Hugging Face 與 AMD 已合作,為 AMD Instinct GPU 上的大型語言模型(LLM)提供即插即用的加速。此整合使使用者能在不需任何程式碼變更的情況下,在 AMD 硬體上運行 Hugging Face Transformers 模型,顯著擴展了高效能 AI 推理與訓練的硬體選項。

Zero-Code Integration for AMD Instinct GPUs

所有 Hugging Face Transformers 模型與任務現在皆支援於 AMD Instinct GPU。使用者可使用與 NVIDIA GPU 通常相同的 PyTorch 程式碼部署模型,只需將裝置設定為 "cuda"。

為確保穩定性與效能,Hugging Face 已在其資料中心內對 AMD Instinct GPU 上的開源程式庫進行整合測試,並利用透過 Verne Global 在冰島部署的伺服器來降低碳足跡。

Technical Optimizations and Feature Support

除了原生支援外,該合作已為 ROCm 驅動的 GPU 整合了數項最先進的加速工具與核心:

  • Flash Attention v2: 透過 AMD 開源工作,原生整合至 Transformers 與 Text Generation Inference (TGI)。
  • Paged Attention: 透過 vLLM 與 TGI 中的各種融合核心,在 ROCm 上受到支援。
  • DeepSpeed: 在 ROCm 驅動的 GPU 上,透過 Transformers 進行官方驗證與支援。
  • GPTQ: 透過直接與 AutoGPTQ 與 Transformers 整合,支援用於降低記憶體需求的權重壓縮。
  • ONNX Runtime: 透過 Optimum 函式庫使用 ROCMExecutionProvider,在 ROCm GPU 上支援 ONNX 模型執行。
  • Optimum-Benchmark: 一項用於在一般與分散式環境中,於 AMD GPU 上基準測試 Transformers 效能的實用工具。

Hardware Performance: AMD Instinct MI250 vs. NVIDIA A100

AMD Instinct MI250 擁有 128 GB 高頻寬記憶體,被分割為兩個獨立的 ROCm 裝置(每個 64 GB)。此架構使單張 MI250 卡能夠作為兩個 PyTorch 裝置運作,促進張量與資料平行處理。

使用 optimum-benchmark 進行的基準測試顯示,MI250 相較於 A100 具有以下效能優勢:

  • Decoding Throughput: 在大批量的生產環境中,MI250 每秒提供的 token 數量超過 A100 的 2.33 倍。
  • Prefill Latency: 相較於 A100,MI250 將首個 token 的時間(prefill latency)減少了一半。
  • Training: MI250 支援更大的批次大小,並達成更高的訓練吞吐量。

Production Deployment with Text Generation Inference (TGI)

Text Generation Inference (TGI) 現在對 AMD Instinct MI210 與 MI250 GPU 提供初步支援。TGI 利用上述優化,提供 LLMs 的端到端大規模部署解決方案。

Llama 模型家族的效能基準測試顯示 MI250 的記憶體優勢。對於需要 138 GB float16 記憶體的 Llama 70B,MI250 的 128 GB 全域記憶體相較於 A100 的 80 GB,能夠處理更大的工作負載、更長的序列以及更大的批次,而 A100 在類似配置下會發生記憶體不足錯誤。

為優化矩陣乘法,Hugging Face 已使用 AMD GeMM Tuner 工具,該工具預計將在未來更新中作為 PyTorch 的一部分發布。

生產部署可透過以下 Docker 映像取得:ghcr.io/huggingface/text-generation-inference:1.2-rocm

Future Roadmap

Hugging Face 與 AMD 正在三個主要領域擴展他們的支援:

  1. Consumer Hardware:將驗證與支援擴展至 AMD Radeon GPU,以供本機桌面使用。
  2. Next-Gen Server GPUs:為即將推出的 AMD Instinct MI300 系列優化效能。
  3. Edge AI:增強筆記型電腦 CPU 中 AMD Ryzen AI 技術的支援,以實現私人、在裝置上執行的 AI。Ryzen AI 相容模型目前已在 Hugging Face Hub 上提供。

Sources