MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

DeepSeek-v4-Flash 0731 recipe for 2x DGX Sparks

このプロジェクトは、DeepSeek-V4-Flash-07312ノードのNVIDIA DGX Spark クラスタ上で実行するためのデプロイメントレシピ(新モデルではない)です。vLLM、DSparkの予測デコード、NVFP4量子化、RoCEネットワーキングを統合し、100万トークンのコンテキスト窓でモデルを提供します。

主な特徴:

  • 2ノードのテンソル並列(TP=2) でNCCL/RoCEを活用、さらにワーカー/ヘッドアーキテクチャを採用。
  • DSpark予測デコード(5トークンのドラフト)により、生成速度を向上。
  • NVFP4 KVキャッシュnvfp4_ds_mla)で大規模なコンテキストをメモリに収容。
  • 100万トークンの上限を実現。6つの並行シーケンスに対応(KVプールが約249万トークンのため安全)。
  • vLLMの既知の問題に対するホットフィックス:推論中にストップ文字列が発火する問題、ツールコールの切り捨て、プレフィルスターバーション、CPUスピン。
  • オプションのビジョンサイドカー(Qwen3-VL-4B)とStage-Cプロファイル(より高いスループット向け)。

パフォーマンス(デフォルトのAnemllスタック):

  • 単一チャット:1トークン目後、約62–83 tok/s
  • 6つの短い並行チャット:合計約160–190 tok/s(1スレッドあたり約30–37)。
  • Stage-Cプロファイル(20万トークン、16スロット):315 tok/s(静的)。

使用方法: .env.dspark.example.env.dspark にコピーし、クラスタIPを設定。Dockerイメージを取得し、重みをダウンロード。その後、ワーカーノードを起動してからヘッドノードを起動。READMEには詳細な環境変数テーブル、トラブルシューティング、ベンチマーク結果が含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • Dispatch