Entrpi/ds4-on-spark
Entrpi/ds4, a Blackwell CUDA perf fork of antirez/ds4 on NVIDIA DGX Spark: one-command install, ~3x upstream prefill, ~1.5x decode, DSpark, and full continuous batch support
解決的問題
本專案提供了一種簡化方式,可在 NVIDIA DGX Spark 硬體上部署與提供 DeepSeek-V4-Flash 模型。它解決了在統一記憶體裝置上最大化吞吐量與上下文視窗使用率的挑戰,透過加入批次服務、連續批次與進階記憶體管理,提供上游引擎的高性能替代方案。
工作原理
本專案使用針對 Blackwell CUDA(sm_121)優化之 ds4 引擎(DwarfStar 4)的分支。實作「記憶體管理器」,避免預先保留記憶體;而是按需映射上下文,並將每個請求的實際記憶體需求與即時系統空閒記憶體進行比對。
主要技術元件包括:
- 推測解碼: 使用 DSpark 實現無損推測解碼,以提升速度。
- KV 快取管理: 實作前綴快取,並使用磁碟持久化 KV 儲存庫,支援重啟後資料留存。
- API 相容性: 支援 OpenAI(Chat/Completions/Responses)與 Anthropic Messages API,可與 Claude Code 和 OpenAI Codex 等代理工具相容。
- 記憶體管理器: 動態管理記憶體,可在單一 Spark 裝置上維持高達 300 萬 token 的活躍上下文而不會當機,並在記憶體耗盡時提供類型化拒絕回應。
適用對象
使用 NVIDIA DGX Spark(GB10/SM121)或高階 Blackwell GPU(RTX PRO 6000 / 5090 級別)的開發者與研究人員,需要為 DeepSeek-V4-Flash 提供高達 100 萬 token 的超大上下文視窗與高吞吐量,以支援智能體工作流程。
主要亮點
- 高效率: 相較上游引擎,預填入吞吐量提升 2.4–3.3 倍,解碼速度提升 1.33–1.47 倍。
- 超大上下文: 支援模型完整的 100 萬 token 視窗,並可維持高達 300 萬 token 的活躍駐留上下文。
- 智能體優化: 包含工具使用協定提醒,並提供可選的推理回聲去除功能,可將提示長度減少 16–28%。
- 一鍵部署: 單一安裝指令碼即可完成主機驗證、引擎建置、GGUF 模型下載與伺服器啟動。
相關
- 專案
- 專案
- Dispatch
- 專案
- Dispatch