MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

GLM-5.3 Flash EXL3 for 2x DGX Sparks

解決的問題

本專案提供了一個高度優化的部署配方與執行階段覆蓋層,用於在特定高階硬體(2x NVIDIA GB10 / DGX Sparks)上服務 GLM-5.3-Flash 模型。它解決了在 SM12x 架構上執行此特定模型架構 (NoPE MLA) 的問題,該問題原本會因為不相容的 KV 快取配置和缺少 sparse-MLA 核心而導致原生 vLLM 崩潰。

運作原理

本專案在 vLLM 之上使用自訂覆蓋層來實作幾項關鍵修復:

  • Sparse-MLA 支援:它對模型的潛在維度進行零填充,以適配 FLASHINFER_MLA_SPARSE_SM120 核心,從而在 SM12x GPU 上實現高效的注意力機制。
  • 量化:它提供模型的 EXL3 4bpw 量化版本,利用融合的 EXL3 MoE 核心來保持路由專家打包狀態。
  • 推測解碼:它整合了 DFlash2 (k=7) 作為推測器以提高解碼速度。
  • KV 快取優化:它實作了打包的 fp8_ds_mla KV 快取和一個「填充插槽共享」分配器,允許草稿模型和目標模型更有效率地共享記憶體。
  • Abliteration:包含一個可選的執行階段掛鉤 (ABLIT=1),用於在載入時對模型權重套用拒絕方向消融,以繞過安全拒絕。

適用對象

適用於能夠存取 NVIDIA GB10/DGX Sparks 硬體,且需要以最大吞吐量、長上下文(最多 1M tokens)和 OpenAI 相容 API 存取來部署 GLM-5.3-Flash 的 AI 工程師和研究人員。

重點特色

  • 高吞吐量:在 4 個並行請求中,每秒可達到 146.5 個聚合 tokens。
  • 海量上下文:支援高達 100 萬 tokens 的最大模型長度。
  • 高效記憶體:使用 4bpw EXL3 量化,以 54% 的記憶體佔用量達到與官方 FP8 相同的品質。
  • 特定硬體:專為 sm_121a cubins 和 CX7 fabric 的 tensor-parallel size 2 進行優化。
  • 自訂修補程式:包含 XGrammar 終止和 Kpool slot-map 限制的回溯移植,以防止在長文本生成期間崩潰。

相關

  • 專案
  • 專案
  • 專案
  • 專案