MiniMax M3 vLLM 支援:面向 1M 令牌多模態推理的 Day-0 服務

MiniMax M3 vLLM 支援:面向 1M 令牌多模態推理的 Day-0 服務

vLLM 宣布對 MiniMax M3 模型系列提供 day-0 支援,包含 BF16 與 MXFP8 檢查點。此版本使得能夠服務需要百萬令牌上下文、原生多模態推理以及具備工具使用與可控思考行為的代理工作流程的工作負載。

MiniMax 稀疏注意力 (MSA) 與 1M 令牌上下文

MiniMax 稀疏注意力 (MSA) 是使 1M 令牌上下文在服務中實用的核心架構創新。MSA 不對整個 KV 快取執行密集注意力,而是使用索引路徑對 128 令牌的 KV 區塊進行打分,僅選取最相關的區塊進行實際的注意力計算。

MSA 執行流程

每個查詢令牌遵循三步流程以最小化注意力計算:

  1. Block Scoring: 小型索引頭對候選 KV 區塊進行打分。
  2. Block Selection: 系統根據學習到的分數與設定規則選取 top‑k 區塊(例如,目前的配方使用 local_blocks=1 以確保查詢令牌附近的本地窗口區塊被保留)。
  3. Sparse GQA: 僅在選取的 KV 區塊上執行線上 softmax 注意力。

KV 快取整合

MiniMax M3 將 KV 資料儲存為普通分頁 KV,使 vLLM 能在計算路徑中套用稀疏性的同時,維持簡單的快取管理器。此架構支援前綴快取與分塊預填,對於重複使用長提示(如程式碼庫或多回合代理追蹤)的工作負載至關重要。

多模態能力與工具使用

MiniMax M3 是原生多模態模型,能同時處理圖像、影片與文字輸入。

多模態請求路徑

為了最佳化 GPU 使用率,vLLM 實作了一條路徑,將 CPU 端的前處理(解碼影格、抽樣影片、調整大小與正規化圖像)放在上游。這確保 vLLM 工作者收到已備妥的張量,將 GPU 時間保留給推論,而非媒體處理。

代理工作流程

此版本包含模型特定的解析器與控制項,以支援代理行為:

  • Tool and Reasoning Parsers: minimax_m3 工具呼叫與推理解析器將模型特定的文字慣例轉換為結構化的 API 回應。
  • Thinking Mode: 使用者可透過 chat_template_kwargsenableddisabledadaptive 等模式控制思考行為。

效能最佳化與服務堆疊

使用 EAGLE3 的投機解碼

Day-0 支援包含使用 Inferact/MiniMax-M3-EAGLE3 草稿模型的 EAGLE3 投機解碼。為維持低延遲,vLLM 更新了 MSA 解碼核心以支援統一的 decode_query_len,使投機驗證能使用解碼專用的 split‑K 路徑,而非回退至較慢的預填核心。

硬體特定後端

服務已針對 NVIDIA 與 AMD 硬體進行最佳化:

  • NVIDIA: 為 MSA 使用預設注意力後端,為視覺編碼器使用 FlashInfer 後端。MXFP8 檢查點在 Blackwell 級系統上使用 DeepGEMM MXFP8 MoE 後端,在 Hopper 級系統上使用 Marlin MXFP8。
  • AMD ROCm: 為 MSA 使用 Triton 注意力後端,為視覺編碼器使用 ROCM_AITER_FA 後端,已在 MI300 與 MI350 系列 GPU 上驗證。

核心融合

為減少 HBM 往返與啟動開銷,vLLM 實作了多項融合,包括 QKNorm + RoPE + KV 插入以及 GemmaNorm 與 AllReduce 的結合。

RL 後訓練整合

除了推論之外,vLLM 服務路徑還支援強化學習後訓練。NVIDIA NeMo RL 現已使用 vLLM 作為 MiniMax M3 的非共置生成後端,支援在 BF16 檢查點上使用專家平行化的群組相對策略優化 (GRPO) 後訓練。

技術路線圖

未來在 vLLM 中對 MiniMax M3 的最佳化包括:

  • FP8 Indexer and KV-Cache: 減少記憶體壓力並提升批次容量。
  • TRTLLM-Gen MoE: 提升 Blackwell 上 MXFP8 專家執行的效能。
  • Context Parallelism: 為超過單節點容量的上下文擴展預填規模。
  • Disaggregated Serving: 擴充 NIXL 與預填/解碼分離的配方。

Sources