vLLM 性能基准:领跑 Artificial Analysis 排行榜
vLLM 在 Artificial Analysis 排行榜上实现了顶级性能,展示了开源推理引擎能够在 NVIDIA Blackwell Ultra 芯片上超越专有堆栈。关键成就包括 DeepSeek V3.2 的每用户输出吞吐量达到 230 TPS,以及 Qwen 3.5 397B 在 10,000 token 提示下的首 token 时间(TTFT)低于 1 秒,获得第一名。
DeepSeek V3.2:降低内核启动开销
DeepSeek V3.2 的性能主要受限于低批量时 GPU 内核启动开销,而非原始计算。vLLM 通过在注意力路径上实施激进的算子融合,将每层约 33 次内核启动合并至约 10 次。此融合涵盖 Q 与 KV 的归一化、Q 与 KV 的旋转嵌入、索引器的层归一化和旋转嵌入、FP8 量化以及 KV 缓存写入。
性能提升:
- 融合影响: 在批量大小为 1 时实现了 1.28 倍加速(在 4× GB200 上未使用 MTP 时从 85.8 提升至 109.3 token/秒)。
- 吞吐量扩展: 在单个 8× B300 节点、并发度 1 时,吞吐量达到未使用 MTP 时 125 token/秒,MTP=1 时 234 token/秒(约 90% 草稿接受率),以及使用预填充/解码拆分(TP=4 + TP=4 + MTP=3)时 262 token/秒。
- Router GEMM 内核: 为小解码批量尺寸的 MoE 路由维度实现的专用内核在批量 1 时额外提升了 6%(PR #34302)。
- TopK 内核: 为稀疏注意力索引器实现的新内核在 128K 上下文解码时将每 token 延迟提升至最高 17%(PR #37421)。
这些优化现在已成为 vLLM 支持 DeepSeek V4 的基础。
MiniMax-M2.5:推测解码与自定义融合
针对 MiniMax-M2.5,vLLM 将针对性内核融合与自定义 EAGLE3 草稿模型相结合。该草稿模型使用 TorchSpec(一个基于 torch 的在线推测解码框架)进行训练,通过消耗实时 vLLM 生成的隐藏状态,以匹配基础模型的精确 token 分布。
技术增强:
- 推测基础设施: 对 MRV2 路径的改进包括草稿模型元数据修复,以提升后期位置的接受率(PR #38311)以及对草稿预填充的 CUDA 图支持(PR #37588)。
- QK-Norm 融合: 实现了自定义
fuse_minimax_qk_norm内核,以处理非标准注意力归一化——在跨张量并行维度上先降低 Q 与 K 的方差,再进行每通道缩放(PR #37045)。 - 极限性能: 在融合以及完美草稿模型(100% 接受率)下,堆栈在并发度 1 时达到了 326 token/秒(TP=4,EAGLE3 + 3 个推测 token)。
Qwen 3.5 397B:线性注意力优化
Qwen 3.5 397B 使用线性注意力和一种非标准归一化变体,最初绕过了 vLLM 的标准 allreduce_rms 融合,导致约一半的解码时间耗费在未融合的跨设备 reduce 上。
优化套件:
- 归一化修复: 更新了
allreduce_rms融合通道,以识别 Qwen 的特定归一化变体,使批量大于 1 时的 TPOT 提升约 5%。 - 后卷积融合: 为线性注意力架构的投影后卷积路径实现了内核融合(PR #37813)。
- 执行效率: 集成了针对 qk-norm + rope 路径以及双流执行的内核级优化,以重叠独立计算分支。
生产结果:
- 并发度 1: 达到 163 token/秒(TEP=8,后卷积融合)。
- 并发度 256: 达到 7.33 请求/秒,比基准 6.69 请求/秒提升了 10%。
对开源推理的影响
上述所有优化——包括 DeepSeek V3.2 的注意力路径融合、MiniMax EAGLE3 配方以及 Qwen 3.5 的融合——要么已合并至 vLLM 主分支,要么正在进行中。这确保了这些基准中取得的性能提升对所有开源引擎用户均可用,挑战了“峰值推理性能需要专有软件堆栈”的假设。