MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

GLM-5.3 Flash EXL3 for 2x DGX Sparks

解决的问题

本项目提供了一个高度优化的部署配方和运行时覆盖层,用于在特定高端硬件(2x NVIDIA GB10 / DGX Sparks)上服务 GLM-5.3-Flash 模型。它解决了在 SM12x 架构上运行此特定模型架构 (NoPE MLA) 的问题,该问题原本会由于不兼容的 KV 缓存布局和缺少 sparse-MLA 内核而导致原生 vLLM 崩溃。

工作原理

本项目在 vLLM 之上使用自定义覆盖层来实现几项关键修复:

  • Sparse-MLA 支持:它对模型的潜在维度进行零填充以适配 FLASHINFER_MLA_SPARSE_SM120 内核,从而在 SM12x GPU 上实现高效的注意力机制。
  • 量化:它提供模型的 EXL3 4bpw 量化版本,利用融合的 EXL3 MoE 内核来保持路由专家的打包状态。
  • 推测解码:它集成了 DFlash2 (k=7) 作为推测器以提高解码速度。
  • KV 缓存优化:它实现了打包的 fp8_ds_mla KV 缓存和一个“填充插槽共享”分配器,允许草稿模型和目标模型更高效地共享内存。
  • Abliteration:包含一个可选的运行时挂钩 (ABLIT=1),用于在加载时对模型权重应用拒绝方向消融以绕过安全拒绝。

适用人群

适用于能够访问 NVIDIA GB10/DGX Sparks 硬件,且需要以最大吞吐量、长上下文(最多 1M tokens)和 OpenAI 兼容 API 访问来部署 GLM-5.3-Flash 的 AI 工程师和研究人员。

核心亮点

  • 高吞吐量:在 4 个并发请求中,每秒可达到 146.5 个聚合 tokens。
  • 海量上下文:支持最大模型长度为 100 万 tokens。
  • 高效内存:使用 4bpw EXL3 量化,以 54% 的内存占用达到与官方 FP8 相同的质量。
  • 特定硬件:专门针对 sm_121a cubins 和 CX7 fabric 的 tensor-parallel size 2 进行优化。
  • 自定义补丁:包含 XGrammar 终止和 Kpool slot-map 限制的向后移植,以防止在长文本生成期间崩溃。

相关

  • 项目
  • 项目
  • 项目
  • 项目