vLLM 性能基准:领跑 Artificial Analysis 排行榜

vLLM 在 Artificial Analysis 排行榜上实现了顶级性能,展示了开源推理引擎能够在 NVIDIA Blackwell Ultra 芯片上超越专有堆栈。关键成就包括 DeepSeek V3.2 的每用户输出吞吐量达到 230 TPS,以及 Qwen 3.5 397B 在 10,000 token 提示下的首 token 时间(TTFT)低于 1 秒,获得第一名。

DeepSeek V3.2:降低内核启动开销

DeepSeek V3.2 的性能主要受限于低批量时 GPU 内核启动开销,而非原始计算。vLLM 通过在注意力路径上实施激进的算子融合,将每层约 33 次内核启动合并至约 10 次。此融合涵盖 Q 与 KV 的归一化、Q 与 KV 的旋转嵌入、索引器的层归一化和旋转嵌入、FP8 量化以及 KV 缓存写入。

性能提升:

  • 融合影响: 在批量大小为 1 时实现了 1.28 倍加速(在 4× GB200 上未使用 MTP 时从 85.8 提升至 109.3 token/秒)。
  • 吞吐量扩展: 在单个 8× B300 节点、并发度 1 时,吞吐量达到未使用 MTP 时 125 token/秒,MTP=1 时 234 token/秒(约 90% 草稿接受率),以及使用预填充/解码拆分(TP=4 + TP=4 + MTP=3)时 262 token/秒。
  • Router GEMM 内核: 为小解码批量尺寸的 MoE 路由维度实现的专用内核在批量 1 时额外提升了 6%(PR #34302)。
  • TopK 内核: 为稀疏注意力索引器实现的新内核在 128K 上下文解码时将每 token 延迟提升至最高 17%(PR #37421)。

这些优化现在已成为 vLLM 支持 DeepSeek V4 的基础。

MiniMax-M2.5:推测解码与自定义融合

针对 MiniMax-M2.5,vLLM 将针对性内核融合与自定义 EAGLE3 草稿模型相结合。该草稿模型使用 TorchSpec(一个基于 torch 的在线推测解码框架)进行训练,通过消耗实时 vLLM 生成的隐藏状态,以匹配基础模型的精确 token 分布。

技术增强:

  • 推测基础设施: 对 MRV2 路径的改进包括草稿模型元数据修复,以提升后期位置的接受率(PR #38311)以及对草稿预填充的 CUDA 图支持(PR #37588)。
  • QK-Norm 融合: 实现了自定义 fuse_minimax_qk_norm 内核,以处理非标准注意力归一化——在跨张量并行维度上先降低 Q 与 K 的方差,再进行每通道缩放(PR #37045)。
  • 极限性能: 在融合以及完美草稿模型(100% 接受率)下,堆栈在并发度 1 时达到了 326 token/秒(TP=4,EAGLE3 + 3 个推测 token)。

Qwen 3.5 397B:线性注意力优化

Qwen 3.5 397B 使用线性注意力和一种非标准归一化变体,最初绕过了 vLLM 的标准 allreduce_rms 融合,导致约一半的解码时间耗费在未融合的跨设备 reduce 上。

优化套件:

  • 归一化修复: 更新了 allreduce_rms 融合通道,以识别 Qwen 的特定归一化变体,使批量大于 1 时的 TPOT 提升约 5%。
  • 后卷积融合: 为线性注意力架构的投影后卷积路径实现了内核融合(PR #37813)。
  • 执行效率: 集成了针对 qk-norm + rope 路径以及双流执行的内核级优化,以重叠独立计算分支。

生产结果:

  • 并发度 1: 达到 163 token/秒(TEP=8,后卷积融合)。
  • 并发度 256: 达到 7.33 请求/秒,比基准 6.69 请求/秒提升了 10%。

对开源推理的影响

上述所有优化——包括 DeepSeek V3.2 的注意力路径融合、MiniMax EAGLE3 配方以及 Qwen 3.5 的融合——要么已合并至 vLLM 主分支,要么正在进行中。这确保了这些基准中取得的性能提升对所有开源引擎用户均可用,挑战了“峰值推理性能需要专有软件堆栈”的假设。

Sources