MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks

GLM-5.3 Flash EXL3 for 2x DGX Sparks

解決する課題

このプロジェクトは、特定のハイエンドハードウェア(2x NVIDIA GB10 / DGX Sparks)上で GLM-5.3-Flash モデルを提供するための、高度に最適化されたデプロイレシピとランタイムオーバーレイを提供します。SM12x アーキテクチャ上でこの特定のモデルアーキテクチャ (NoPE MLA) を実行する問題を解決します。これは、互換性のない KV キャッシュレイアウトと sparse-MLA カーネルの欠落により、標準の vLLM ではクラッシュしてしまう問題です。

仕組み

このプロジェクトは、vLLM の上にカスタムオーバーレイを使用して、いくつかの重要な修正を実装しています:

  • Sparse-MLA サポート: モデルの潜在次元をゼロパディングして FLASHINFER_MLA_SPARSE_SM120 カーネルに適合させ、SM12x GPU 上で効率的なアテンションを可能にします。
  • 量子化: モデルの EXL3 4bpw 量子化バージョンを提供し、融合された EXL3 MoE カーネルを利用して、ルーティングされたエキスパートをパック状態に保ちます。
  • 投機的デコーディング: デコード速度を向上させるために、スペキュレーターとして DFlash2 (k=7) を統合しています。
  • KV キャッシュ最適化: パックされた fp8_ds_mla KV キャッシュと「パディングされたスロット共有」アロケーターを実装し、ドラフトモデルとターゲットモデルがメモリをより効率的に共有できるようにします。
  • Abliteration: ロード時にモデルの重みに拒否方向のアブレーションを適用し、安全上の拒否をバイパスするためのオプションのランタイムフック (ABLIT=1) を含みます。

対象者

NVIDIA GB10/DGX Sparks ハードウェアにアクセスでき、最大のスループット、長いコンテキスト(最大 1M トークン)、および OpenAI 互換の API アクセスを使用して GLM-5.3-Flash をデプロイする必要がある AI エンジニアおよび研究者向けです。

ハイライト

  • 高スループット: 4 つの同時リクエストで、集計で毎秒最大 146.5 トークンを達成します。
  • 大規模コンテキスト: 最大 100 万トークンのモデル長をサポートします。
  • 効率的なメモリ: 4bpw EXL3 量子化を使用し、メモリフットプリントの 54% で公式の FP8 品質に匹敵します。
  • ハードウェア固有: tensor-parallel size 2 のために sm_121a cubins と CX7 fabric に特化して最適化されています。
  • カスタムパッチ: 長時間の生成中のクラッシュを防ぐための XGrammar 終了と Kpool slot-map クランプのバックポートが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト