Entrpi/ds4-on-spark

Entrpi/ds4, a Blackwell CUDA perf fork of antirez/ds4 on NVIDIA DGX Spark: one-command install, ~3x upstream prefill, ~1.5x decode, DSpark, and full continuous batch support

何を解決するか

このプロジェクトは、NVIDIA DGX Sparkハードウェア上で DeepSeek-V4-Flash モデルをデプロイおよびサービングするための簡潔な方法を提供します。ユニファイドメモリデバイス上でスループットとコンテキストウィンドウの利用を最大化する課題に対処し、バッチサーバー、連続バッチ、高度なメモリ管理を追加することで、上流エンジンの高性能な代替手段を提供します。

動作方法

このプロジェクトは、Blackwell CUDA(sm_121)向けに最適化された ds4 エンジン(DwarfStar 4)のフォークを使用しています。メモリを事前に予約しない「メモリガバナー」を実装しており、代わりにコンテキストをオンデマンドでマップし、各リクエストの実際のメモリ要件を実行中のシステムの空きメモリと照合します。

主な技術的構成要素は以下の通りです:

  • 予測デコード(Speculative Decoding): DSpark を使用して損失のない予測デコードを実現し、速度を向上させます。
  • KVキャッシュ管理: ディスク永続化されたKVバンクを用いたプレフィックスキャッシュを実装し、再起動後もデータを保持します。
  • API互換性: OpenAI(Chat/Completions/Responses)および Anthropic Messages API をサポートしており、Claude Code や OpenAI Codex などのエージェントと連携可能です。
  • メモリガバナー: メモリを動的に管理し、単一の Spark デバイス上で最大 300 万トークンのアクティブコンテキストを維持可能にし、メモリが枯渇した場合は型付きの拒否を返します。

対象ユーザー

NVIDIA DGX Spark(GB10/SM121)またはハイエンド Blackwell GPU(RTX PRO 6000 / 5090クラス)を使用し、最大 100 万トークンの巨大コンテキストウィンドウと高スループットを必要とする、エージェントワークフロー向けの DeepSeek-V4-Flash をサーブする開発者および研究者。

特徴

  • 高性能: 上流エンジンと比較して、プレフィルスループットが 2.4~3.3倍、デコード速度が 1.33~1.47倍向上。
  • 巨大コンテキスト: モデルの最大 100 万トークンのウィンドウをサポートし、最大 300 万トークンのアクティブな常駐コンテキストを維持可能。
  • エージェント最適化: ツール使用のプロトコルリマインダーを含み、推論エコーを削除するオプションにより、プロンプト長を 16~28%短縮可能。
  • ワンコマンドセットアップ: 1つのインストールスクリプトでホスト検証、エンジンビルド、GGUFモデルのダウンロード、サーバー起動をすべて自動化。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch