在 AMD Instinct MI355X 上優化 MiniMax M3

vLLM 已大幅優化 MiniMax M3 在 AMD Instinct MI355X 上的服務效能,於低併發情境下,MXFP8 標準服務的輸出吞吐量最高提升至 3.14 倍。此成果透過迭代式地識別並解決整個堆疊中的瓶頸而達成,涵蓋 GEMM 分塊、核心融合,以及分散式系統協調等層面。

在 AMD Instinct MI355X 上的效能基準

優化工作已帶來 MiniMax M3 在各種設定下的吞吐量與延遲顯著提升:

  • MXFP8 標準服務(併發 32): 每 GPU 輸出 token 數由 109.1 提升至 342.4(3.14×)。中位數首次輸出時間(TTFT)由 1.46 秒降至 0.67 秒,平均每輸出 token 時間(TPOT)由 69.1 毫秒降至 22.1 毫秒。
  • MXFP8 標準服務(併發 128): 每 GPU 輸出 token 數由 297.8 提升至 623.7(2.09×)。中位數 TTFT 由 3.53 秒降至 1.54 秒,平均 TPOT 由 100.7 毫秒降至 48.8 毫秒。
  • MXFP4 服務(併發 128): 在 TP4/EP1 上,吞吐量由 212.1 提升至 716.8 輸出 token/s/GPU。進一步優化至 TP2/EP1 後,達到 943.5 輸出 token/s/GPU,較初始結果提升 4.45 倍。
  • 預測解碼(EAGLE3): 在 TP4/EP1 上,併發 128 時達到 682.4 輸出 token/s/GPU。
  • P/D 分離(Prefill/Decode Disaggregation): 在併發 512 時,總輸出 token 數達 6,370.5 token/s/GPU,中位數 TTFT 為 1.32 秒。

核心與運算元優化

效能提升源自於對局部形狀分析的系統性方法,以及消除冗餘運算。

局部形狀與分塊

vLLM 優化了 GEMM 啟動器,以處理預填(large-M)與解碼(small-M)的不同情境。透過為解碼選擇較窄的 N 分塊,並增加 K 步長以減少迴圈次數,vLLM 將 TP8 8K/1K 的輸出吞吐量提升了 7.8–9.4%。此外,重新排序群組式 MoE 程式,使鄰近程式能重用 GPU 快取中的激活行與專家權重分塊,在 TP4 測試中帶來 1.08×–1.46× 的提升。

共享專家融合

MiniMax M3 的共享專家原本以獨立的密集 MLP 路徑執行。vLLM 將共享專家融合至路由專家表中,使群組式 GEMM 可同時處理兩者。此舉消除了獨立啟動與中間通訊,於併發 1 時提升輸出吞吐量 30.2%,於併發 128 時提升 5.6%。

稀疏注意力與索引重用

為降低稀疏注意力的開銷,vLLM 實作了索引共享機制,讓後續層重用前層的 top-k 區塊決策。此舉在併發 1 時將平均 TPOT 減少約 10%。此外,vLLM 開發了稀疏頁面適配器,將 MiniMax M3 的 128 token 邏輯區塊映射至 AITER 的 16 token 頁面,無需複製 KV 資料,於 TP4、併發 256 時提升輸出吞吐量 5.56%(MXFP8)至 6.93%(MXFP4)。

分散式系統與預測執行

優化範疇已超越單一核心,延伸至多 GPU 協調與預測解碼整合。

EAGLE3 預測解碼

vLLM 將 EAGLE3 草稿模型整合至 AMD 硬體,實作請求層級索引批次處理,將所有草稿位置一併處理。此舉使索引核心效能提升最高達 48.9%。此外,將 AITER 稀疏分頁注意力擴展至多 token 驗證,於 TP4 測試中使輸出吞吐量提升 7.90%(MXFP8)與 8.32%(MXFP4)。

預填/解碼(P/D)分離

vLLM 透過精確推導每層的傳輸幾何與位元組偏移,實現 P/D 分離,確保 KV 正確交接。系統調校顯示,將所有工作節點移至 TP4,並對 8K/1K 工作負載採用兩名 TP4 預填工作節點對應一名 TP4 解碼工作節點的比例,於併發 512 時達成 6,370.5 總輸出 token/s/GPU,中位數 TTFT 為 1.32 秒。

智能代理工作負載分析

使用 AgentX 基準測試智能代理程式碼(包含不規則輸出與可重用前置詞),vLLM 在併發 28 時測試了 MXFP4、EAGLE3-GQA 與前置詞快取的組合。系統提供 127.4 輸出 token/s/GPU 與 509.5 總輸出 token/s,中位數 TTFT 為 645 ms,中位數 TPOT 為 41.3 ms。分析顯示 GPU 快取命中率達 92.1%,KV 快取利用率為 88.5%,顯示未來優化應聚焦於前置詞對齊與淘汰策略,而非進一步 GEMM 調校。

優化方法論檢查清單

為優化未來模型服務路徑,vLLM 提出以下技術檢查清單:

  1. 局部形狀分析: 在分區後記錄局部形狀直方圖,包含重複頭部與路由 token 數量。
  2. 重複性估計: 計算每層工作量乘以層數、輸出 token 數與活躍請求數。
  3. 位元平面分離: 区分計算張量、持久狀態與通訊。
  4. 快速路徑驗證: 記錄每條快速路徑的資格條件,並透過調度追蹤驗證實際執行。
  5. 正確性門檻: 在性能門檻之外實作正確性檢查。
  6. 迭代式剖析: 當葉核心平坦化後,檢視更高層級的佇列、擁有權、快取容量與作業系統限制。

Sources