MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
DeepSeek-v4-Flash 0731 recipe for 2x DGX Sparks
このプロジェクトは、DeepSeek-V4-Flash-0731 を 2ノードのNVIDIA DGX Spark クラスタ上で実行するためのデプロイメントレシピ(新モデルではない)です。vLLM、DSparkの予測デコード、NVFP4量子化、RoCEネットワーキングを統合し、100万トークンのコンテキスト窓でモデルを提供します。
主な特徴:
- 2ノードのテンソル並列(TP=2) でNCCL/RoCEを活用、さらにワーカー/ヘッドアーキテクチャを採用。
- DSpark予測デコード(5トークンのドラフト)により、生成速度を向上。
- NVFP4 KVキャッシュ(
nvfp4_ds_mla)で大規模なコンテキストをメモリに収容。 - 100万トークンの上限を実現。6つの並行シーケンスに対応(KVプールが約249万トークンのため安全)。
- vLLMの既知の問題に対するホットフィックス:推論中にストップ文字列が発火する問題、ツールコールの切り捨て、プレフィルスターバーション、CPUスピン。
- オプションのビジョンサイドカー(Qwen3-VL-4B)とStage-Cプロファイル(より高いスループット向け)。
パフォーマンス(デフォルトのAnemllスタック):
- 単一チャット:1トークン目後、約62–83 tok/s。
- 6つの短い並行チャット:合計約160–190 tok/s(1スレッドあたり約30–37)。
- Stage-Cプロファイル(20万トークン、16スロット):315 tok/s(静的)。
使用方法: .env.dspark.example を .env.dspark にコピーし、クラスタIPを設定。Dockerイメージを取得し、重みをダウンロード。その後、ワーカーノードを起動してからヘッドノードを起動。READMEには詳細な環境変数テーブル、トラブルシューティング、ベンチマーク結果が含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- Dispatch