tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark
DeepSeek V4 Flash DSpark 1M NVFP4 KV recipe for 2x DGX Spark
解决的问题
本项目为 DeepSeek-V4-Flash-Vision-Exp 多模态模型在 2 节点 DGX Spark 集群上提供高性能部署方案。它专门解决了该模型缺乏生产级服务引擎的问题,提供了必要的端口和补丁,使 vLLM 内部能够支持原生图像输入和推测解码。
工作原理
该项目使用 vLLM 作为服务引擎,跨两个节点配置张量并行(TP=2)。通过多个关键组件优化性能:
- DSpark 推测解码:使用草稿模型每步预测多个 token,显著提升吞吐量。
- NVFP4 KV 缓存:采用实验性
nvfp4_ds_mlaKV 缓存,支持高达 100 万 token 的上下文窗口。 - 自定义绑定挂载:由于模型的视觉架构在标准 vLLM 类中不被原生支持,项目通过只读绑定挂载,将必要的视觉模型文件(如
ds4v_model.py)和关键 bug 修复(补丁 3 和补丁 4)直接注入运行时环境。
适用人群
拥有 DGX Spark 硬件访问权限的 ML 工程师和研究人员,希望以高吞吐量、大上下文窗口和原生视觉能力部署 DeepSeek-V4-Flash-Vision-Exp 模型。
核心亮点
- 原生视觉支持:实现了 32 层 ViT 和对齐器的真实移植,避免使用 VLM 代理。
- 超大上下文:支持高达 1,048,576 个 token 的校准上下文。
- 推测加速:使用 DSpark 配置
k=5草稿长度,在特定工作负载下实现高达 80.1 tok/s 的高 token/秒速率。 - 关键 bug 修复:包含补丁 4,修复了 DSpark 草稿共享专家加载器中的静默失败问题,否则会将解码速度减半。
相关
- 项目
- 项目
- 项目
- 项目