MiaAI-Lab/DeepSeek-v4-Flash-One-DGX-Spark
DeepSeek v4 Flash EXL3 on one DGX Spark
何を解決するか
このプロジェクトは、NVIDIA DGX Sparkハードウェア上で DeepSeek V4 Flash 0731 モデルの高性能かつ単一ノードでのデプロイ起動ツールを提供します。通常、公式の FP4 ビルドでは必要とされるマルチノード構成(テンソル並列 2)を不要にし、1台のデバイス上で高スループットと巨大なコンテキスト窓を実現できます。
動作方法
このプロジェクトは、128 GiB の統合メモリを備えた NVIDIA DGX Spark(GB10、SM121)向けに最適化された Docker ベースのレシピを使用しています。sparkinfer カーネルスタックと EXL3 量子化(3.0 bpw)を活用して、モデルを1ノードに収容します。パフォーマンス最適化のため、K64 ドラフトモデルを使用した DSpark K5 予測デコードを実装し、nvfp4_ds_mla 圧縮 KV キャッシュを使用しています。また、CUDA-graph キャプチャを導入し、並列デコードが最適化されたグラフ上で実行されるようにし、イアジー実行にフォールバックしないようにしています。
対象ユーザー
NVIDIA DGX Spark ハードウェアにアクセスがある開発者や研究者で、DeepSeek V4 Flash を最大効率でデプロイし、長文コンテキスト(最大 384k トークン)を活用し、OpenAI 互換 API にアクセスしたい方。
特徴
- 単一ノードデプロイ: 2台目のノードを必要とせず、1台の DGX Spark で動作。
- 巨大コンテキスト窓: 384,000 トークンまでサポートし、検証済みの正確な "針の山の中の針" リコールを実現。
- 予測デコード: DSpark K5 予測デコードを使用し、トークン生成を高速化。
- 最適化されたメモリ使用: 圧縮 KV キャッシュとチューニングされた GPU メモリ利用率(0.94)により、余裕を最大化。
- ランタイムの消去: モデル重みを変更せずに、拒否方向を削除するオプションの非破壊的ランタイム投影を提供。
- ローカル重み管理: 完全にローカルな重みのダウンロードとコアリス、SSHFS を通じたオプションの LAN 共有モードをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト