EAGLE-3 投機解碼於 AMD Instinct GPU
EAGLE-3 投機解碼於 AMD Instinct GPU
vLLM 與 AMD Quark 團隊已在 AMD Instinct GPU 上推出 EAGLE-3 投機解碼的端到端管線,使大型混合專家(MoE)和注意力密集型模型能夠實現無損推理加速。此整合在 AMD Instinct MI355X GPU 上為 Kimi-K2.5 提供 1.69x 至 2.00x 的吞吐量提升,為 MiniMax-M2.5 提供 1.38x 至 1.79x 的吞吐量提升。
投機解碼與 EAGLE-3 方法
投機解碼是一種無損加速技術,可減少昂貴目標模型解碼迭代的次數。與其一個一個生成 token,輕量草稿模型會提出多個未來 token,然後目標模型在單次前向傳遞中進行驗證。與目標模型分布匹配的 token 會被接受,並從第一個被拒絕的 token 繼續生成。
EAGLE-3 透過利用目標模型的多層特徵,改進了之前的版本。與其使用無關的小型語言模型,EAGLE-3 訓練一個與目標模型緊密對齊的草稿模組,利用低階、中階和高階語義特徵來提升草稿的接受率和整體推理速度。
AMD Quark MXFP4 量化
為了解決大型 MoE 模型的記憶體頻寬和容量限制,AMD Quark 團隊使用 MXFP4 (OCP Microscaling 4-bit 浮點) 格式為主流 LLM 提供「第零天」量化。
MXFP4 實作的關鍵技術細節包括:
- 硬體加速:AMD Instinct MI350 系列 GPU (MI350X/MI355X) 提供原生 FP4 矩陣加速。
- 記憶體效率:MXFP4 將 4 位元元素分組為小塊,共用一個縮放因子,在減少記憶體佔用的同時,保持優於 INT4 的數值行為。
- vLLM 整合:這些檢查點透過 ROCm 上的 vLLM 經由 FP4 ASM GEMM 路徑 (
VLLM_ROCM_USE_AITER_FP4_ASM_GEMM=1) 和 AITER MoE 核心被消費。
以 vLLM 為中心的 EAGLE-3 訓練管線
訓練高接受率的草稿模型被視為一個系統問題,vLLM 作為訓練迴圈的核心,分為五個階段:
- 現場政策資料合成:vLLM 提供 AMD Quark MXFP4 目標模型,使用精確的服務聊天模板生成回應,以確保訓練與部署的一致性。
- 隱藏狀態提取:vLLM 的隱藏狀態提取鉤子直接從運行中的目標引擎暴露輔助層(低階、中階和高階隱藏狀態以及
fc_norm)。這支援線上、離線和串流模式,後者使得在單一節點上訓練 420B MXFP4 MoE 目標成為可能。 - 冷啟動 FSDP2 訓練:單層 EAGLE-3 草稿頭在 FSDP2 下,使用訓練時測試 (TTT) 損失和位置衰減權重從頭開始訓練。
- 迴圈內服務-評估:當前檢查點會定期匯出並在 vLLM 投機解碼下提供服務,以測量真實接受長度,確保所選檢查點已針對生產引擎進行優化。
- 匯出與部署:最終草稿會匯出為 Hugging Face 格式,並透過 vLLM-ROCm 進行部署。
草稿品質與情境縮放
在 SPEED-Bench 的評估顯示,MiniMax-M3 EAGLE-3 草稿在 11 個領域中的平均接受長度 (AL) 為 2.77。最高接受率出現在結構化技術內容:
- 編碼:3.16 AL
- 數學:3.12 AL
- RAG:3.11 AL
- 多語言:3.07 AL
值得注意的是,隨著提示長度從 1K 增加到 32K 個 token (2.64 到 2.63),接受長度保持穩定,表明加速效果不會在長上下文中衰減。
AMD Instinct MI355X 的效能基準測試
在 AMD Instinct MI355X (TP=4) 上使用 1K 輸入和 1K 輸出 token (1K/1K) 進行的基準測試顯示,相較於非投機基準,吞吐量有顯著提升:
Kimi-K2.5 結果
- BF16 草稿路徑:吞吐量提升 1.69x 至 1.90x。
- AMD Quark FP8 草稿路徑:吞吐量提升 1.76x 至 2.00x。
MiniMax-M2.5 結果
- BF16 草稿路徑:吞吐量提升 1.38x 至 1.79x。
在兩個模型中,效能提升在較低的並發級別時最為顯著。
摘要: vLLM 和 AMD Quark 已在 AMD Instinct GPU 上實現 EAGLE-3 投機解碼的端到端管線,對 Kimi-K2.5 達成最高 2.00x 的吞吐量提升,對 MiniMax-M2.5 達成最高 1.79x 的吞吐量提升。