MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

DeepSeek-v4-Flash 0731 recipe for 2x DGX Sparks

本项目是运行 DeepSeek-V4-Flash-0731部署配方(非新模型),可在 2节点 NVIDIA DGX Spark 集群上部署。通过整合 vLLM、DSpark 预测解码、NVFP4 量化和 RoCE 网络,实现 100万 token 上下文窗口 的模型服务。

核心特性:

  • 2节点张量并行(TP=2),使用 NCCL/RoCE,外加工作节点/主控节点架构。
  • DSpark 预测解码(5个草稿 token)以实现更快生成。
  • NVFP4 KV 缓存nvfp4_ds_mla)以将超大上下文装入内存。
  • 100万 token 上限,支持 6 个并发序列(因 KV 池约 249 万 token,安全)。
  • 修复已知 vLLM 问题:推理中停止字符串误触发、工具调用截断、预填充饥饿、CPU 自旋。
  • 可选视觉侧车(Qwen3-VL-4B)和 Stage-C 配置文件(用于更高吞吐量)。

性能(默认 Anemll 堆栈):

  • 单个聊天:首 token 后约 62–83 tok/s
  • 六个短并发聊天:总吞吐约 160–190 tok/s(每流约 30–37)。
  • Stage-C 配置文件(20万上下文,16 个槽位):315 tok/s(静态)。

使用方法:.env.dspark.example 复制为 .env.dspark,设置集群 IP,拉取 Docker 镜像,下载权重,然后先启动工作节点,再启动主控节点。README 包含详细的环境变量表、故障排查和基准测试结果。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • Dispatch