tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark

DeepSeek V4 Flash DSpark 1M NVFP4 KV recipe for 2x DGX Spark

何を解決するか

このプロジェクトは、2ノードのDGX Sparkクラスタ上でDeepSeek-V4-Flash-Vision-Expマルチモーダルモデルの高性能デプロイメントレシピを提供します。このモデルには生産用のサービングエンジンが存在しないため、vLLM内でのネイティブな画像入力と予測デコードを可能にするために必要なポートとパッチを提供しています。

仕組み

プロジェクトはvLLMをサービングエンジンとして利用し、2ノード間でテンソル並列(TP=2)を設定しています。パフォーマンス最適化のために、以下の重要なコンポーネントを採用しています:

  • DSpark予測デコード:ドラフトモデルを使用して1ステップあたり複数トークンを予測し、大幅にスループットを向上させます。
  • NVFP4 KVキャッシュ:実験的な nvfp4_ds_mla KVキャッシュを採用し、100万トークンの巨大なコンテキスト窓をサポートします。
  • カスタムバインドマウント:モデルのビジョンアーキテクチャが標準のvLLMクラスではネイティブにサポートされていないため、読み取り専用のバインドマウントを使用して、必要なビジョンモデルファイル(ds4v_model.pyなど)と重要なバグ修正(パッチ3およびパッチ4)をランタイム環境に直接挿入しています。

対象ユーザー

DGX SparkハードウェアにアクセスできるMLエンジニアおよび研究者で、高スループット、大規模コンテキスト窓、ネイティブビジョン機能を備えたDeepSeek-V4-Flash-Vision-Expモデルのデプロイを希望する方。

主な特徴

  • ネイティブビジョンサポート:32ブロックのViTとアライナーの本物のポートを実装し、VLMプロキシを回避します。
  • 巨大コンテキスト:最大1,048,576トークンの調整済みコンテキストをサポートします。
  • 予測による高速化:DSparkをk=5のドラフト長で設定し、特定のワークロードで80.1 tok/sの高いトークン/秒を達成します。
  • 重要なバグ修正:パッチ4により、DSparkドラフト共有エキスパートローダーの静黙的な失敗を修正し、デコード速度が半分になるのを防ぎます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト