MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark
Qwen3.8-Flash-Next on ONE DGX Spark (TP=1)
解决的问题
本项目提供一个自包含的部署方案和脚本,用于在单台 DGX Spark 机器上部署 Mia-AiLab/Qwen3.8-Flash-Next-NVFP4 视觉语言模型。它特别解决了将一个大型(99 GiB)检查点适配到机器统一内存中的挑战,同时保持文本、图像和视频处理的高性能。
工作原理
系统使用 vLLM 作为推理引擎,将 PLE 表卸载并内存映射,以优化内存使用。采用多种性能优化技术,包括:
- 推测解码:使用 MTP(多标记预测)和精简词汇量的草稿模型,提升解码速度。
- 内存管理:实现主机侧内存上限(
HOST_RESERVE_GIB),防止系统不稳定和内存泄漏。 - KV 缓存优化:支持 FP8 KV 缓存,增加内存中可存储的标记数量。
- 多模态支持:集成 27 层视觉塔,通过 OpenAI 兼容的 API 形式原生支持图像和视频处理(时间顺序识别已验证)。
适用人群
拥有 DGX Spark 硬件访问权限,希望以最小配置开销部署高性能多模态视觉语言模型的开发者和研究人员。
核心亮点
- 多模态能力:原生支持文本、图像和视频(时间顺序识别已验证)。
- 高吞吐量:在特定配置下,8 个流的总吞吐量可达 162.9 个标记/秒。
- 优化的预填充:包含 PLE 页面故障预取机制,减少首次标记时间(TTFT)。
- 灵活配置:通过环境变量轻松调整上下文长度、推测深度和内存预算。
相关
- 项目
- 项目
- 项目
- 项目