Entrpi/ds4-on-spark

Entrpi/ds4, a Blackwell CUDA perf fork of antirez/ds4 on NVIDIA DGX Spark: one-command install, ~3x upstream prefill, ~1.5x decode, DSpark, and full continuous batch support

解决的问题

本项目提供了一种在 NVIDIA DGX Spark 硬件上部署和提供 DeepSeek-V4-Flash 模型的简化方式。它解决了在统一内存设备上最大化吞吐量和上下文窗口利用率的挑战,通过增加批处理服务、连续批处理和高级内存管理,为上游引擎提供高性能替代方案。

工作原理

该项目使用针对 Blackwell CUDA(sm_121)优化的 ds4 引擎(DwarfStar 4)的分支。实现了“内存管理器”,避免预先预留内存;而是按需映射上下文,并将每个请求的实际内存需求与系统实时空闲内存进行比对。

关键技术组件包括:

  • 推测解码: 使用 DSpark 实现无损推测解码,以提升速度。
  • KV 缓存管理: 实现了基于磁盘持久化 KV 存储库的前缀缓存,支持重启后数据保留。
  • API 兼容性: 支持 OpenAI(Chat/Completions/Responses)和 Anthropic Messages API,可与 Claude Code 和 OpenAI Codex 等代理工具兼容。
  • 内存管理器: 动态管理内存,可在单个 Spark 设备上维持高达 300 万 token 的活跃上下文而不会崩溃,并在内存耗尽时提供类型化拒绝响应。

适用人群

使用 NVIDIA DGX Spark(GB10/SM121)或高端 Blackwell GPU(RTX PRO 6000 / 5090 级别)的开发者和研究人员,需要为 DeepSeek-V4-Flash 提供高达 100 万 token 的超大上下文窗口和高吞吐量,以支持智能体工作流。

主要亮点

  • 高性能: 相比上游引擎,预填充吞吐量提升 2.4–3.3 倍,解码速度提升 1.33–1.47 倍。
  • 超大上下文: 支持模型完整的 100 万 token 上下文窗口,并可维持高达 300 万 token 的活跃驻留上下文。
  • 智能体优化: 包含工具使用协议提醒,并提供可选的推理回声去除功能,可将提示长度减少 16–28%。
  • 一键部署: 单个安装脚本即可完成主机验证、引擎构建、GGUF 模型下载和服务器启动。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • Dispatch