MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark

DeepSeek v4 Flash EXL3 on one DGX Spark

解決的問題

本專案為 NVIDIA DGX Spark 硬體上的 DeepSeek V4 Flash 0731 模型提供高效率的單節點部署啟動器。無需通常用於官方 FP4 建構的多節點設定(張量平行 2),即可在單一裝置上執行模型,實現高吞吐量與超大上下文視窗。

工作原理

本專案使用針對 NVIDIA DGX Spark(GB10,SM121)優化之 Docker 配方,配備 128 GiB 統一記憶體。它利用 sparkinfer 核心堆疊與 EXL3 量化(3.0 bpw)將模型適配至單一節點。為優化效能,實作 DSpark K5 預測解碼,使用 K64 草稿模型,並採用 nvfp4_ds_mla 壓縮 KV 快取。同時包含 CUDA 圖捕捉,確保併發解碼始終在優化圖上執行,而非回退至急切執行。

適用對象

擁有 NVIDIA DGX Spark 硬體的開發者與研究人員,希望以最高效率部署 DeepSeek V4 Flash,支援超長上下文(最高 384k 令牌),並具備 OpenAI 相容 API 存取能力。

特色亮點

  • 單節點部署:無需第二台節點,可在一台 DGX Spark 上運行。
  • 超大上下文視窗:支援高達 384,000 個令牌,經驗證可實現精確的「針尖藏於草堆」式召回。
  • 預測解碼:使用 DSpark K5 預測解碼,加速令牌生成。
  • 優化記憶體使用:採用壓縮 KV 快取與調校的 GPU 記憶體利用率(0.94),最大化可用空間。
  • 執行時消融:包含可選的非破壞性執行時投影,無需修改模型權重即可移除拒絕指令。
  • 本地權重管理:完全本地的權重下載與合併,支援透過 SSHFS 的可選區域網路共享模式。

相關

  • 專案
  • 專案
  • 專案
  • 專案