MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
DeepSeek-v4-Flash 0731 recipe for 2x DGX Sparks
本專案是執行 DeepSeek-V4-Flash-0731 的 部署配方(非新模型),可在 2節點 NVIDIA DGX Spark 集群上運行。整合 vLLM、DSpark 預測解碼、NVFP4 量化與 RoCE 網路,提供 100萬 token 上下文視窗 的模型服務。
核心功能:
- 2節點張量平行(TP=2),使用 NCCL/RoCE,並採用工作節點/主控節點架構。
- DSpark 預測解碼(5個草稿 token)以加速生成。
- NVFP4 KV 快取(
nvfp4_ds_mla)以將超大上下文載入記憶體。 - 100萬 token 上限,支援 6 個並行序列(因 KV 池約 249 萬 token,安全)。
- 修復已知 vLLM 問題:推理中停止字串誤觸發、工具呼叫截斷、預填入飢餓、CPU 自旋。
- 可選視覺側車(Qwen3-VL-4B)與 Stage-C 設定檔(用於更高吞吐量)。
效能(預設 Anemll 堆疊):
- 單一對話:首個 token 後約 62–83 tok/s。
- 六個短並行對話:總吞吐約 160–190 tok/s(每串流約 30–37)。
- Stage-C 設定檔(20萬上下文,16 個槽位):315 tok/s(靜態)。
使用方式: 將 .env.dspark.example 複製為 .env.dspark,設定叢集 IP,拉取 Docker 影像,下載權重,然後先啟動工作節點,再啟動主控節點。README 包含詳細的環境變數表格、故障排除與基準測試結果。
相關
- 專案
- 專案
- 專案
- Dispatch
- Dispatch