MiaAI-Lab/Qwen3.8-27B-SGLang-DGX-Spark
Qwen3.8 27B on SGLang for DGX Spark
它解决了什么问题
该项目提供了一套经过优化、开箱即用的 Docker 脚本,可在 NVIDIA DGX Spark(GB10)硬件上部署 Qwen3.8-27B 模型。通过提供针对不同推测解码引擎的预测量配置,消除了手动调优的不确定性,确保在此特定架构上实现最大吞吐量和稳定性。
它如何工作
该仓库使用 SGLang 作为推理引擎,并将其封装在 Docker 容器中。它提供了三种基于不同推测解码方法的推理模式,以加速 token 生成:
- EAGLE/MTP:使用检查点内的头进行推测解码。
- DSpark:采用独立的草稿模型,加速代码和通用对话。
- DFlash2:使用块扩散草稿模型(需要通过提供的补丁构建自定义镜像),优化代码和长文本写作。
为了在 GB10 的 ARM 架构上实现最佳性能,脚本将进程绑定到高性能的 Cortex-X5 核心,并利用 FP8 KV 缓存以节省内存。同时支持通过 YaRN 缩放将上下文窗口扩展至 100 万 token。
适合谁使用
希望在 NVIDIA DGX Spark(GB10)硬件上部署 Qwen3.8-27B 并获得最佳性能,但又不想手动调整 SGLang 标志和内存比例的开发者与研究人员。
主要亮点
- 三种推测解码引擎:支持 MTP、DSpark 和 DFlash2,每种均针对不同工作负载进行了调优(例如,DSpark 适用于代码,MTP 适用于长篇论文)。
- 硬件特定调优:绑定至 Cortex-X5 核心,解码速度提升 2-7%,并优化了 GDN 状态池。
- 灵活的上下文支持:原生支持 262K 上下文,可选通过 YaRN 扩展至 1M token。
- 自动化部署:提供幂等的启动/停止脚本,以及 DFlash2 支持的自动 Docker 镜像构建。
相关
- 项目
- 项目
- 项目
- 项目
- 项目