Google Cloud C4 與 Intel Xeon 6 在 GPT OSS 上的效能
Google Cloud C4 虛擬機(VM)搭載 Intel Xeon 6 處理器(Granite Rapids),相較於前一代 C3 實例,在 GPT OSS 大型語言模型(LLM)推論的總擁有成本(TCO)提升了 1.7 倍。此效能提升源自新一代硬體與 Hugging Face transformers 函式庫中針對性的軟體最佳化的結合。
效能提升與 TCO 改善
在執行 GPT OSS 模型時,Google Cloud C4 虛擬機展現出相較於 C3 虛擬機更優秀的吞吐量與成本效益。以批次大小 64 為例,C4 實例的每個 vCPU 吞吐量是 C3 實例的 1.7 倍。由於每小時成本隨 vCPU 數量線性增長,此效能提升直接轉化為 1.7 倍的 TCO 優勢,亦即 C3 實例需要花費 1.7 倍的成本才能產生相同數量的 token。
關鍵指標包括:
- 吞吐量: 每美元每 vCPU 的 TPOT(每輸出 token 時間)吞吐量提升 1.4 倍至 1.7 倍。
- 成本: 相較於 C3 虛擬機,每小時價格更低。
MoE 推論的技術最佳化
GPT OSS 是一個開源的專家混合(Mixture of Experts,MoE)模型。MoE 架構使用 gating 網路將輸入導向專門的「專家」子網路,使模型在不線性增加計算成本的情況下擴充容量。由於每個 token 只會啟動少量的專家,CPU 推論對於這類大型模型而言成為可行的選項。
為了進一步提升效能,Intel 與 Hugging Face 在 transformers 函式庫中實作了專家執行最佳化(透過 PR #40304 合併)。此最佳化透過確保每個專家僅處理被特定導向的 token,避免了冗餘計算,而非處理所有 token。此變更消除浪費的 FLOP,提升整體硬體利用率。
基準測試方法與硬體
基準測試採用受控且可重複的生成工作負載,以分離 Intel Xeon 6(GNR)與第 4 代 Intel Xeon(SPR)處理器之間的架構差異。
硬體配置
| 實例 | 架構 | vCPU 數 |
|---|---|---|
| C3 | 第 4 代 Intel Xeon 處理器 (SPR) | 172 |
| C4 | Intel Xeon 6 處理器 (GNR) | 144 |
工作負載參數
- 模型:
unsloth/gpt-oss-120b-BF16 - 精度: bfloat16
- 輸入/輸出長度: 每段 1024 個 token
- 批次大小: 1、2、4、8、16、32、64
- 最佳化: 靜態 KV 快取與 SDPA(Scaled Dot Product Attention)注意力後端,以確保確定性。
結論
Intel 與 Hugging Face 的合作證明,大型 MoE 模型可以在新一代通用 CPU 上高效服務。透過在 Google Cloud C4 虛擬機中結合 Intel Xeon 6 架構與特定框架最佳化,開發者能在大規模 LLM 推論中獲得更高的吞吐量、更低的延遲以及降低的營運成本。