MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
DeepSeek-v4-Flash 0731 recipe for 2x DGX Sparks
本项目是运行 DeepSeek-V4-Flash-0731 的 部署配方(非新模型),可在 2节点 NVIDIA DGX Spark 集群上部署。通过整合 vLLM、DSpark 预测解码、NVFP4 量化和 RoCE 网络,实现 100万 token 上下文窗口 的模型服务。
核心特性:
- 2节点张量并行(TP=2),使用 NCCL/RoCE,外加工作节点/主控节点架构。
- DSpark 预测解码(5个草稿 token)以实现更快生成。
- NVFP4 KV 缓存(
nvfp4_ds_mla)以将超大上下文装入内存。 - 100万 token 上限,支持 6 个并发序列(因 KV 池约 249 万 token,安全)。
- 修复已知 vLLM 问题:推理中停止字符串误触发、工具调用截断、预填充饥饿、CPU 自旋。
- 可选视觉侧车(Qwen3-VL-4B)和 Stage-C 配置文件(用于更高吞吐量)。
性能(默认 Anemll 堆栈):
- 单个聊天:首 token 后约 62–83 tok/s。
- 六个短并发聊天:总吞吐约 160–190 tok/s(每流约 30–37)。
- Stage-C 配置文件(20万上下文,16 个槽位):315 tok/s(静态)。
使用方法: 将 .env.dspark.example 复制为 .env.dspark,设置集群 IP,拉取 Docker 镜像,下载权重,然后先启动工作节点,再启动主控节点。README 包含详细的环境变量表、故障排查和基准测试结果。
相关
- 项目
- 项目
- 项目
- Dispatch
- Dispatch