tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark
DeepSeek V4 Flash DSpark 1M NVFP4 KV recipe for 2x DGX Spark
解決的問題
本專案為 DeepSeek-V4-Flash-Vision-Exp 多模態模型在 2 節點 DGX Spark 集群上提供高效率部署方案。專案特別解決此模型缺乏生產級服務引擎的問題,提供必要的端口與修補程式,使 vLLM 內部能支援原生影像輸入與推測解碼。
工作原理
本專案使用 vLLM 作為服務引擎,跨兩個節點配置張量平行(TP=2)。透過多個關鍵元件優化效能:
- DSpark 推測解碼:使用草稿模型每步預測多個 token,顯著提升吞吐量。
- NVFP4 KV 快取:採用實驗性
nvfp4_ds_mlaKV 快取,支援高達 100 萬 token 的上下文視窗。 - 自訂繫結掛載:由於模型的視覺架構在標準 vLLM 類別中未被原生支援,專案透過唯讀繫結掛載,將必要的視覺模型檔案(如
ds4v_model.py)與關鍵 bug 修復(補丁 3 與補丁 4)直接注入執行時環境。
適用對象
擁有 DGX Spark 硬體存取權限的 ML 工程師與研究人員,希望以高吞吐量、大上下文視窗與原生視覺能力部署 DeepSeek-V4-Flash-Vision-Exp 模型者。
核心亮點
- 原生視覺支援:實現 32 層 ViT 與對齊器的真實移植,避免使用 VLM 代理。
- 超大上下文:支援高達 1,048,576 個 token 的校準上下文。
- 推測加速:使用 DSpark 配置
k=5草稿長度,在特定工作負載下達成高達 80.1 tok/s 的高 token/秒速率。 - 關鍵 bug 修復:包含補丁 4,修復 DSpark 草稿共享專家載入器中的靜默失敗問題,否則會使解碼速度減半。
相關
- 專案
- 專案
- 專案
- 專案