vLLM Day 0 Support for Qwen3.8-2.4T-A95B
vLLM 现在提供对 Qwen3.8-2.4T-A95B 的 Day-0 支持,使得部署具有开放权重的 Qwen-Max 级模型成为可能。此版本集成了 Qwen 3.5 架构,允许模型在无需更改架构的情况下直接在 vLLM 上运行。
Model Architecture and Hardware Requirements
Qwen3.8-2.4T-A95B 是一个具有 2.4 万亿参数和 512 个专家的稀疏混合专家 (MoE) 模型。其 92 层混合骨干网络利用了一种特定的注意力机制:每 4 层应用一次全注意力 (full attention),而其余 69 层则使用线性注意力 (linear attention)。
硬件推理需求因精度而异:
- Full Precision/FP8: 需要至少两个 NVIDIA B300 或 AMD MI355X 节点。
- FP4 Quantized: 可以在单个节点上运行。
Precision and Quantization Options
除了官方的 BF16 和 FP8 检查点外,Inferact 还发布了 MXFP4 和 NVFP4 量化权重。这些 FP4 版本使用带激活校准的 Round-to-Nearest (RTN) 量化,以实现 4-bit 激活,专门针对路由专家 (routed experts) 和选定层以减少内存和带宽开销。
初步验证显示,FP4 量化保持了准确性。例如,在 GSM8K 基准测试(严格/灵活)中,NVFP4 版本达到了 90.37% / 91.05%,而 FP8 为 89.61% / 90.52%。在 AIME25 @3 (avg/pass) 中,NVFP4 达到了 92.22% / 96.67%,而 FP8 为 87.78% / 93.33%。
Hardware-Specific Optimizations
为了支持这种规模的模型,vLLM 与 NVIDIA 和 AMD 协作开发了优化内核 (kernels):
NVIDIA Platforms
NVIDIA 和 Inferact 开发了用于 Dense GEMMs、MoE routing、Attention (GQA) 和 Linear Attention (Gated Delta Rule) 的超快速内核。该实现包括新的融合内核 (fused kernels) 以最小化通信开销,并对工作进行了特定分解,将数据并行 (Data Parallelism) 和张量并行 (Tensor Parallelism) 用于 Attention,并将专家并行 (Expert Parallelism) 用于 MoE。
AMD Instinct GPUs
通过 AITER-fused Gated DeltaNet decode、attention 和 MoE 内核实现加速,这些内核减少了数据移动和内核启动开销。共享专家路径利用了优化的 hipBLASLt GEMM 内核,而路由专家则使用 AITER FusedMoE。此外,AMD Quark 量化支持使得高效的 MXFP4 部署成为可能。
Deployment and Configuration
为了获得最佳性能,Qwen 3.8 模型卡片建议使用以下生成参数:
- Temperature: 1.0
- Top_p: 0.95
- Top_k: 20
- Min_p: 0.0
- Presence Penalty: 0.0
- Repetition Penalty: 1.0
由于 Qwen 3.8 是一个推理模型,建议用户设置较高的 max_tokens 值(例如, 128,000)以提供充足的 token 预算用于智能体工作流 (agentic workflows)。
Quick Start Commands
NVFP4 Deployment:
vllm serve Inferact/Qwen3.8-2.4T-A95B-NVFP4 \
--linear-backend flashinfer_cutedsl \
--tensor-parallel-size 8 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
MXFP4 Deployment:
vllm serve Inferact/Qwen3.8-2.4T-A95B-MXFP4 \
--tensor-parallel-size 8 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--speculative-config '{"method":"mtp":"mtp","num_speculative_tokens":3}'
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch