tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark
DeepSeek V4 Flash DSpark 1M NVFP4 KV recipe for 2x DGX Spark
何を解決するか
このプロジェクトは、2ノードのDGX Sparkクラスタ上でDeepSeek-V4-Flash-Vision-Expマルチモーダルモデルの高性能デプロイメントレシピを提供します。このモデルには生産用のサービングエンジンが存在しないため、vLLM内でのネイティブな画像入力と予測デコードを可能にするために必要なポートとパッチを提供しています。
仕組み
プロジェクトはvLLMをサービングエンジンとして利用し、2ノード間でテンソル並列(TP=2)を設定しています。パフォーマンス最適化のために、以下の重要なコンポーネントを採用しています:
- DSpark予測デコード:ドラフトモデルを使用して1ステップあたり複数トークンを予測し、大幅にスループットを向上させます。
- NVFP4 KVキャッシュ:実験的な
nvfp4_ds_mlaKVキャッシュを採用し、100万トークンの巨大なコンテキスト窓をサポートします。 - カスタムバインドマウント:モデルのビジョンアーキテクチャが標準のvLLMクラスではネイティブにサポートされていないため、読み取り専用のバインドマウントを使用して、必要なビジョンモデルファイル(
ds4v_model.pyなど)と重要なバグ修正(パッチ3およびパッチ4)をランタイム環境に直接挿入しています。
対象ユーザー
DGX SparkハードウェアにアクセスできるMLエンジニアおよび研究者で、高スループット、大規模コンテキスト窓、ネイティブビジョン機能を備えたDeepSeek-V4-Flash-Vision-Expモデルのデプロイを希望する方。
主な特徴
- ネイティブビジョンサポート:32ブロックのViTとアライナーの本物のポートを実装し、VLMプロキシを回避します。
- 巨大コンテキスト:最大1,048,576トークンの調整済みコンテキストをサポートします。
- 予測による高速化:DSparkを
k=5のドラフト長で設定し、特定のワークロードで80.1 tok/sの高いトークン/秒を達成します。 - 重要なバグ修正:パッチ4により、DSparkドラフト共有エキスパートローダーの静黙的な失敗を修正し、デコード速度が半分になるのを防ぎます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト