MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks
GLM-5.3 Flash EXL3 for 2x DGX Sparks
解決的問題
本專案提供了一個高度優化的部署配方與執行階段覆蓋層,用於在特定高階硬體(2x NVIDIA GB10 / DGX Sparks)上服務 GLM-5.3-Flash 模型。它解決了在 SM12x 架構上執行此特定模型架構 (NoPE MLA) 的問題,該問題原本會因為不相容的 KV 快取配置和缺少 sparse-MLA 核心而導致原生 vLLM 崩潰。
運作原理
本專案在 vLLM 之上使用自訂覆蓋層來實作幾項關鍵修復:
- Sparse-MLA 支援:它對模型的潛在維度進行零填充,以適配
FLASHINFER_MLA_SPARSE_SM120核心,從而在 SM12x GPU 上實現高效的注意力機制。 - 量化:它提供模型的 EXL3 4bpw 量化版本,利用融合的 EXL3 MoE 核心來保持路由專家打包狀態。
- 推測解碼:它整合了 DFlash2 (k=7) 作為推測器以提高解碼速度。
- KV 快取優化:它實作了打包的
fp8_ds_mlaKV 快取和一個「填充插槽共享」分配器,允許草稿模型和目標模型更有效率地共享記憶體。 - Abliteration:包含一個可選的執行階段掛鉤 (
ABLIT=1),用於在載入時對模型權重套用拒絕方向消融,以繞過安全拒絕。
適用對象
適用於能夠存取 NVIDIA GB10/DGX Sparks 硬體,且需要以最大吞吐量、長上下文(最多 1M tokens)和 OpenAI 相容 API 存取來部署 GLM-5.3-Flash 的 AI 工程師和研究人員。
重點特色
- 高吞吐量:在 4 個並行請求中,每秒可達到 146.5 個聚合 tokens。
- 海量上下文:支援高達 100 萬 tokens 的最大模型長度。
- 高效記憶體:使用 4bpw EXL3 量化,以 54% 的記憶體佔用量達到與官方 FP8 相同的品質。
- 特定硬體:專為
sm_121acubins 和 CX7 fabric 的 tensor-parallel size 2 進行優化。 - 自訂修補程式:包含 XGrammar 終止和 Kpool slot-map 限制的回溯移植,以防止在長文本生成期間崩潰。
相關
- 專案
- 專案
- 專案
- 專案