MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

DeepSeek-v4-Flash 0731 recipe for 2x DGX Sparks

本專案是執行 DeepSeek-V4-Flash-0731部署配方(非新模型),可在 2節點 NVIDIA DGX Spark 集群上運行。整合 vLLM、DSpark 預測解碼、NVFP4 量化與 RoCE 網路,提供 100萬 token 上下文視窗 的模型服務。

核心功能:

  • 2節點張量平行(TP=2),使用 NCCL/RoCE,並採用工作節點/主控節點架構。
  • DSpark 預測解碼(5個草稿 token)以加速生成。
  • NVFP4 KV 快取nvfp4_ds_mla)以將超大上下文載入記憶體。
  • 100萬 token 上限,支援 6 個並行序列(因 KV 池約 249 萬 token,安全)。
  • 修復已知 vLLM 問題:推理中停止字串誤觸發、工具呼叫截斷、預填入飢餓、CPU 自旋。
  • 可選視覺側車(Qwen3-VL-4B)與 Stage-C 設定檔(用於更高吞吐量)。

效能(預設 Anemll 堆疊):

  • 單一對話:首個 token 後約 62–83 tok/s
  • 六個短並行對話:總吞吐約 160–190 tok/s(每串流約 30–37)。
  • Stage-C 設定檔(20萬上下文,16 個槽位):315 tok/s(靜態)。

使用方式:.env.dspark.example 複製為 .env.dspark,設定叢集 IP,拉取 Docker 影像,下載權重,然後先啟動工作節點,再啟動主控節點。README 包含詳細的環境變數表格、故障排除與基準測試結果。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • Dispatch