MiniMax M3 vLLM 支持:面向 1M Token 多模态推理的 Day-0 部署
MiniMax M3 vLLM 支持:Day-0 部署 1M Token 多模态推理
vLLM 已宣布对 MiniMax M3 系列模型提供 Day-0 支持,涵盖 BF16 和 MXFP8 检查点。此发布使得能够为需要百万 Token 上下文、原生多模态推理以及具备工具使用和可控思考行为的代理工作流提供服务。
MiniMax 稀疏注意力 (MSA) 与 1M Token 上下文
MiniMax Sparse Attention (MSA) 是实现 1M Token 上下文实际可用的核心架构创新。MSA 并非对整个 KV 缓存执行密集注意力,而是通过索引路径对 128 Token 的 KV 块进行打分,仅选择最相关的块用于实际的注意力计算。
MSA 执行流程
每个查询 Token 都遵循三步流程以最小化注意力计算工作:
- Block Scoring(块打分): 小型索引头对候选 KV 块进行打分。
- Block Selection(块选择): 系统根据学习得到的分数和配置规则(例如当前配方使用
local_blocks=1以确保查询 Token 附近的局部窗口块被保留)选择 top‑k 块。 - Sparse GQA(稀疏 GQA): 仅在选中的 KV 块上运行在线 Softmax 注意力。
KV 缓存集成
MiniMax M3 将 KV 数据存储为普通分页 KV,使 vLLM 能够保持简易的缓存管理器,同时在计算路径中应用稀疏性。该架构支持前缀缓存和分块预填充,这对于重复使用长提示(如代码库或多轮代理轨迹)的工作负载至关重要。
多模态能力与工具使用
MiniMax M3 是原生多模态模型,能够在处理文本的同时处理图像和视频输入。
多模态请求路径
为优化 GPU 利用率,vLLM 实现了一条路径,在上游完成 CPU 端的预处理(解码帧、采样视频、调整大小以及归一化图像)。这确保 vLLM 工作进程收到已准备好的张量,将 GPU 时间用于推理而非媒体处理。
代理工作流
此发布包含模型特定的解析器和控制器,以支持代理行为:
- Tool and Reasoning Parsers(工具与推理解析器):
minimax_m3工具调用和推理解析器将模型特定的文本约定转换为结构化的 API 响应。 - Thinking Mode(思考模式): 用户可通过
chat_template_kwargs使用enabled、disabled或adaptive等模式来控制思考行为。
性能优化与服务栈
使用 EAGLE3 的投机解码
Day-0 支持包括使用 Inferact/MiniMax-M3-EAGLE3 草稿模型的 EAGLE3 投机解码。为保持低延迟,vLLM 更新了 MSA 解码内核以支持统一的 decode_query_len,使投机验证能够使用专用于解码的 split‑K 路径,而不必回退到较慢的预填充内核。
硬件特定后端
服务针对 NVIDIA 与 AMD 硬件均进行了优化:
- NVIDIA: 对 MSA 使用默认注意力后端,对视觉编码器使用 FlashInfer 后端。MXFP8 检查点在 Blackwell 级系统上使用 DeepGEMM MXFP8 MoE 后端,在 Hopper 级系统上使用 Marlin MXFP8。
- AMD ROCm: 对 MSA 使用 Triton 注意力后端,对视觉编码器使用 ROCM_AITER_FA 后端,已在 MI300 与 MI350 系列 GPU 上验证。
内核融合
为减少 HBM 往返次数和启动开销,vLLM 实现了多项融合,包括 QKNorm + RoPE + KV 插入以及 GemmaNorm 与 AllReduce 的组合。
RL 后训练集成
除推理外,vLLM 的服务路径还支持强化学习后训练。NVIDIA NeMo RL 现已使用 vLLM 作为 MiniMax M3 的非共址生成后端,支持在 BF16 检查点上使用专家并行进行 Group Relative Policy Optimization (GRPO) 后训练。
技术路线图
MiniMax M3 在 vLLM 中的未来优化包括:
- FP8 Indexer and KV-Cache(FP8 索引器与 KV 缓存): 降低内存压力并提升批次容量。
- TRTLLM-Gen MoE(TRTLLM-Gen 多专家): 提升 Blackwell 上 MXFP8 专家执行的性能。
- Context Parallelism(上下文并行): 为超出单节点容量的上下文扩展预填充规模。
- Disaggregated Serving(分离式服务): 拓展 NIXL 与预填充/解码分离配方。
SUMMARY: vLLM 已发布对 MiniMax M3 系列模型的 Day-0 支持,借助 MiniMax Sparse Attention (MSA) 实现高效的 1M Token 上下文服务和原生多模态推理。
TITLE: MiniMax M3 vLLM 支持:面向 1M Token 多模态推理的 Day-0 部署