vLLM 效能基準:領先人工分析排行榜

vLLM 效能基準:領先人工分析排行榜

vLLM 在人工分析排行榜上取得了頂級效能,證明開源推論引擎在 NVIDIA Blackwell Ultra 晶片上可以超越專有堆疊。主要成就包括 DeepSeek V3.2 的每位使用者輸出吞吐量達 230 TPS,以及 Qwen 3.5 397B 在 10,000 token 提示下的首 token 時間 (TTFT) 低於 1 秒,獲得第一名。

DeepSeek V3.2:降低核心啟動開銷

DeepSeek V3.2 的效能主要受限於低批次大小時的 GPU 核心啟動開銷,而非純計算。vLLM 透過在注意力路徑上實施積極的運算融合,將每層大約 33 次核心啟動合併至約 10 次。此融合涵蓋 Q 與 KV 正規化、Q 與 KV 的旋轉嵌入、索引器的層正規化與旋轉嵌入、FP8 量化,以及 KV 快取寫入。

效能提升:

  • 融合影響: 在批次大小 1 時提供 1.28 倍的加速(從 85.8 提升至 109.3 tok/s,於 4× GB200 未使用 MTP 的情況下)。
  • 吞吐量擴展: 在單一 8× B300 節點、併發度 1 時,吞吐量達到未使用 MTP 時 125 tok/s,MTP=1 時 234 tok/s(約 90% 草稿接受率),以及使用 prefill/decode 分離時 262 tok/s(TP=4 + TP=4 + MTP=3)。
  • Router GEMM 核心: 為小解碼批次尺寸的 MoE 路由維度設計的專用核心,在批次 1 時額外提升 6%(PR #34302)。
  • TopK 核心: 為稀疏注意力索引器開發的新核心,使每 token 延遲在 128K 上下文解碼時提升最高 17%(PR #37421)。

這些最佳化現在成為 vLLM 支援 DeepSeek V4 的基礎。

MiniMax-M2.5:推測解碼與自訂融合

對於 MiniMax-M2.5,vLLM 結合了針對性的核心融合與自訂的 EAGLE3 草稿模型。該草稿模型使用 TorchSpec(torch 原生的線上推測解碼框架)進行訓練,透過消耗即時 vLLM 產生的隱藏狀態,以匹配基礎模型的精確 token 分布。

技術增強:

  • 推測基礎設施: 對 MRV2 路徑的改進包括草稿模型元資料修正,以提升後期位置的接受率(PR #38311),以及對草稿 prefill 的 CUDA graph 支援(PR #37588)。
  • QK 正規化融合: 實作了自訂的 fuse_minimax_qk_norm 核心,以處理非標準的注意力正規化,該正規化在每通道縮放前先在張量平行等級上降低 Q 與 K 的變異(PR #37045)。
  • 上限效能: 在融合與完美草稿模型(100% 接受率)下,堆疊在併發度 1 時達到 326 tok/s(TP=4,EAGLE3 + 3 個推測 token)。

Qwen 3.5 397B:線性注意力最佳化

Qwen 3.5 397B 採用線性注意力與非標準的正規化變體,最初繞過了 vLLM 標準的 allreduce_rms 融合,導致約一半的解碼時間耗費在未融合的跨設備 reduction 上。

最佳化套件:

  • 正規化修正: 更新了 allreduce_rms 融合通道,以識別 Qwen 的特定正規化變體,使批次大小大於 1 時的 TPOT 提升約 5%。
  • 後卷積融合: 為線性注意力架構的投影後卷積路徑實作了核心融合(PR #37813)。
  • 執行效率: 整合了針對 qk-norm + rope 路徑以及雙流執行的核心層級最佳化,以重疊獨立的計算分支。

生產結果:

  • 併發度 1: 達到 163 tok/s(TEP=8,後卷積融合)。
  • 併發度 256: 達到 7.33 req/s,比 6.69 req/s 基線提升 10%。

開源推論的意涵

上述所有最佳化——包括 DeepSeek V3.2 注意力路徑的融合、MiniMax EAGLE3 配方,以及 Qwen 3.5 的融合——已全部合併至 vLLM 主分支或正處於開發中。這確保了在這些基準測試中取得的效能提升可供所有開源引擎使用者使用,挑戰了「最高推論效能必須依賴專有軟體堆疊」的假設。

Sources