MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

DeepSeek v4 Flash EXL3 on one DGX Spark

解决的问题

本项目为 NVIDIA DGX Spark 硬件上的 DeepSeek V4 Flash 0731 模型提供高性能单节点部署启动器。无需通常用于官方 FP4 构建的多节点设置(张量并行 2),即可在单个设备上运行模型,实现高吞吐量和超大上下文窗口。

工作原理

该项目使用针对 NVIDIA DGX Spark(GB10,SM121)优化的 Docker 配方,配备 128 GiB 统一内存。它利用 sparkinfer 内核栈和 EXL3 量化(3.0 bpw)将模型适配到单个节点。为优化性能,实现了 DSpark K5 预测解码,使用 K64 草稿模型,并采用 nvfp4_ds_mla 压缩 KV 缓存。同时包含 CUDA 图捕获,确保并发解码始终在优化图上运行,而非回退到急切执行。

适用人群

拥有 NVIDIA DGX Spark 硬件的开发者和研究人员,希望以最高效率部署 DeepSeek V4 Flash,支持超长上下文(最高 384k 令牌),并具备 OpenAI 兼容 API 访问能力。

特色亮点

  • 单节点部署:无需第二台节点,可在一台 DGX Spark 上运行。
  • 超大上下文窗口:支持高达 384,000 个令牌,经验证可实现精确的「针尖藏于草堆」式召回。
  • 预测解码:使用 DSpark K5 预测解码,加速令牌生成。
  • 优化内存使用:采用压缩 KV 缓存和调优的 GPU 内存利用率(0.94),最大化可用空间。
  • 运行时消融:包含可选的非破坏性运行时投影,无需修改模型权重即可移除拒绝指令。
  • 本地权重管理:完全本地的权重下载与合并,支持通过 SSHFS 的可选局域网共享模式。

相关

  • 项目
  • 项目
  • 项目
  • 项目