blazux/qwen3.8-Flash-DGX
recipe for running Qwen3.8-Flash-Next on a single DGX Spark
何を解決するか
このプロジェクトは、Qwen3.8-Flash-Nextモデル(約176Bパラメータ)を単一のNVIDIA DGX Spark / ASUS GX10システム上でデプロイ可能にします。特に、モデルのNVFP4チェックポイント(約125 GiB)が、必要なKVキャッシュと組み合わせると、利用可能な128 GBのユニファイドメモリプールを超えるというメモリ制約に対処しています。また、GB10ハードウェアにおけるプレフィックスキャッシュのバグと非決定的デコードに関するvLLMの重大なバグも修正しています。
仕組み
- NVMe mmapによる重みの利用:メモリ節約のため、プロジェクトはvLLMを修正し、大きなn-gram埋め込み(PLE)テーブルをRAMに保持する代わりにNVMeから
mmapで提供するようにしています。これにより、常駐重みは約125 GiBから約75 GiBに削減されます。 - カスタムパッチ:公式vLLMイメージに12個以上のパッチを適用し、プレフィックスキャッシュ(Mamba状態バグ)、スパースアテンションにおける非決定的top-k、ツール呼び出しパースエラーを修正しています。
- ハイブリッドチェックポイント:オプションのハイブリッドレイアウト(NVFP4エキスパート + fp8サイドレイヤー)を提供し、デコード速度を約20%向上させます。
- 最適化されたサービング:Dockerビルド、重みのダウンロード(Xet経由)、サービングプロファイル(例:
speed,context,default)を管理するためのflashCLIツールを使用しています。
対象ユーザー
- NVIDIA DGX SparkまたはASUS GX10ハードウェアを使用し、単一マシン上で最大500k~1Mトークンの高コントキストで巨大なQwenモデルを実行したい開発者や研究者。
主な特徴
- メモリ効率:重みのフットプリントを約75 GiBに削減し、大きなKVキャッシュ(約680kトークン)に余裕を残します。
- 高性能:GX10上で単一ストリームデコードで約34 tok/s、プリフィルで約2,500~2,800 tok/sを達成します。
- 決定論的出力:決定論的キーナルをカスタムで導入し、プリフィル速度を損なわずに一貫したグリーディデコードを保証します。
- 信頼性の高いツールパース:コードブロック内の構文ドキュメント時に誤ってツール呼び出しが発動するのを防ぐためのガードを実装しています。
- 簡単なデプロイ:セットアップ、ヘルスチェック、サービングを一括で行うスムーズな
./flashコマンドを提供しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト