Google Cloud C4 与 Intel Xeon 6 在 GPT OSS 上的性能
Google Cloud C4 虚拟机(VM)搭载 Intel Xeon 6 处理器(Granite Rapids),相较于上一代 C3 实例,在 GPT OSS 大型语言模型(LLM)推理方面提供了 1.7 倍的总拥有成本(TCO)提升。这种效率来源于下一代硬件与 Hugging Face transformers 库中针对性的软件优化相结合。
性能提升与 TCO 改进
在运行 GPT OSS 模型时,Google Cloud C4 虚拟机相较于 C3 虚拟机展示出更高的吞吐量和成本效率。在批量大小为 64 时,C4 实例的每个 vCPU 吞吐量是 C3 实例的 1.7 倍。由于每小时费用随 vCPU 数量线性增长,这一性能提升直接转化为 1.7 倍的 TCO 优势,也就是说 C3 实例需要花费 1.7 倍的费用才能生成相同数量的 token。
关键指标包括:
- Throughput: 1.4x 到 1.7x TPOT(每输出 token 时间)每 vCPU 每美元的吞吐量。
- Cost: 相比 C3 虚拟机更低的每小时价格。
MoE 推理的技术优化
GPT OSS 是一个开源的专家混合(Mixture of Experts,MoE)模型。MoE 架构使用门控网络将输入路由到专门的“专家”子网络,使模型能够在不线性增加计算成本的情况下扩展容量。由于每个 token 只激活少量专家,CPU 推理成为这些大模型的可行选项。
为进一步提升效率,Intel 与 Hugging Face 在 transformers 库中实现了专家执行优化(通过 PR #40304 合并)。该优化通过确保每个专家仅处理被专门路由给它的 token,消除冗余计算,而不是处理所有 token。此更改消除了浪费的 FLOPs 并提升了整体硬件利用率。
基准测试方法与硬件
基准测试使用受控且可重复的生成工作负载进行,以隔离 Intel Xeon 6(GNR)与第 4 代 Intel Xeon(SPR)处理器之间的架构差异。
硬件配置
| 实例 | 架构 | vCPUs |
|---|---|---|
| C3 | 第 4 代 Intel Xeon 处理器(SPR) | 172 |
| C4 | Intel Xeon 6 处理器(GNR) | 144 |
工作负载参数
- Model:
unsloth/gpt-oss-120b-BF16 - Precision: bfloat16
- Input/Output Length: 每个 1024 token
- Batch Sizes: 1、2、4、8、16、32、64
- Optimizations: 静态 KV 缓存和 SDPA(Scaled Dot Product Attention)注意力后端,以确保确定性。
结论
Intel 与 Hugging Face 的合作表明,大型 MoE 模型可以在下一代通用 CPU 上高效部署。通过将 Google Cloud C4 虚拟机中的 Intel Xeon 6 架构与特定的框架优化相结合,开发者能够在大规模 LLM 推理中实现更高的吞吐量、更低的延迟以及更低的运营成本。