vLLM 對 Qwen3.8-2.4T-A95B 的 Day 0 支援

vLLM 現在為 Qwen3.8-2.4T-A95B 提供 Day-0 支援,使得部署 Qwen-Max 級別的開源權重模型成為可能。此版本整合了 Qwen 3.5 架構,讓模型無需進行架構更改即可在 vLLM 上開箱即用。

模型架構與硬體需求

Qwen3.8-2.4T-A95B 是一個擁有 2.4 兆參數和 512 個專家的稀疏混合專家 (MoE) 模型。其 92 層混合骨幹網路採用了特定的注意力機制:每 4 層應用一次全注意力 (full attention),其餘 69 層則使用線性注意力 (linear attention)。

推理的硬體需求因精度而異:

  • 全精度/FP8: 至少需要兩個 NVIDIA B300 或 AMD MI355X 節點。
  • FP4 量化: 可在單個節點上運行。

精度與量化選項

除了官方的 BF16 和 FP8 檢查點外,Inferact 還發佈了 MXFP4 和 NVFP4 量化權重。這些 FP4 版本使用帶有激活校準的最近捨入 (RTN) 量化,以實現 4-bit 激活,特別針對路由專家和選定層進行優化,以減少記憶體和頻寬開銷。

初步驗證顯示 FP4 量化能保持準確度。例如,在 GSM8K 基準測試(嚴格/靈活)中,NVFP4 版本達到了 90.37% / 91.05%,而 FP8 為 89.61% / 90.52%。在 AIME25 @3 (平均/通過) 上,NVFP4 達到 92.22% / 96.67%,而 FP8 為 87.78% / 93.33%。

硬體特定優化

為了支援如此規模的模型,vLLM 與 NVIDIA 和 AMD 合作開發了優化內核 (kernels):

NVIDIA 平台

NVIDIA 和 Inferact 為 Dense GEMMs、MoE 路由、Attention (GQA) 和 Linear Attention (Gated Delta Rule) 開發了超快速內核。實作包含新的融合內核 (fused kernels) 以最小化通訊開銷,並對工作進行特定分解,將數據並行 (Data Parallelism) 與張量並行 (Tensor Parallelism) 結合用於 Attention,並將專家並行 (Expert Parallelism) 用於 MoE。

AMD Instinct GPU

透過 AITER-fused Gated DeltaNet 解碼、Attention 和 MoE 內核實現加速,這減少了數據移動和內核啟動的開銷。共享專家路徑利用優化的 hipBLASLt GEMM 內核,而路由專家則使用 AITER FusedMoE。此外,AMD Quark 量化支援實現了高效的 MXFP4 部署。

部署與配置

為了獲得最佳性能,Qwen 3.8 模型卡建議使用以下生成參數:

  • Temperature: 1.0
  • Top_p: 0.95
  • Top_k: 20
  • Min_p: 0.0
  • Presence Penalty: 0.0
  • Repetition Penalty: 1.0

由於 Qwen 3.8 是一個推理模型,建議用戶設置較高的 max_tokens 值(例如 128,000),為代理工作流 (agentic workflows) 提供充足的 token 預算。

快速入門指令

NVFP4 部署:

vllm serve Inferact/Qwen3.8-2.4T-A95B-NVFP4 \
  --linear-backend flashinfer_cutedsl \
  --tensor-parallel-size 8 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}'

MXFP4 部署:

vllm serve Inferact/Qwen3.8-2.4T-A95B-MXFP4 \
  --tensor-parallel-size 8 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3 \
  --speculative-config '{"method":"mtp":"mtp","num_speculative_tokens":3}'

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch