MiaAI-Lab/Qwen3.8-27B-SGLang-DGX-Spark

Qwen3.8 27B on SGLang for DGX Spark

解決する問題

このプロジェクトは、NVIDIA DGX Spark(GB10)ハードウェア上でQwen3.8-27Bモデルを最適化された、即座に実行可能なDockerスクリプトのセットを提供します。手動でのチューニングの試行錯誤を排除し、さまざまな推測デコードエンジン向けに事前に測定された設定を提供することで、この特定のアーキテクチャ上で最大のスループットと安定性を確保します。

動作方法

このリポジトリはSGLangを推論エンジンとして使用し、Dockerコンテナでラップしています。トークン生成を高速化するための推測デコード手法に基づいて、3つの異なるサービングモードを提供しています。

  • EAGLE/MTP: 推測デコードにチェックポイント内に配置されたヘッドを使用します。
  • DSpark: コードや一般チャットの高速化に、別途のドラフトモデルを使用します。
  • DFlash2: ブロック差分拡散ドラフトモデル(提供されたパッチを用いたカスタムビルドが必要)を使用し、コードおよび長文作成の両方を最適化します。

GB10のARMアーキテクチャ上でパフォーマンスを最大化するため、スクリプトはプロセスを高性能なCortex-X5コアにピン止めし、FP8 KVキャッシュを活用してメモリを節約します。また、YaRNスケーリングを介して最大100万トークンまでのコンテキストウィンドウ拡張もサポートしています。

対象ユーザー

NVIDIA DGX Spark(GB10)ハードウェアを使用し、SGLangのフラグやメモリ割合を手動でチューニングせずに、Qwen3.8-27Bを最適なパフォーマンスでデプロイしたい開発者や研究者です。

特徴

  • 3つの推測エンジン: MTP、DSpark、DFlash2のサポート。それぞれ異なるワークロードに最適化されています(例:DSparkはコード向け、MTPは長文エッセイ向け)。
  • ハードウェア固有のチューニング: Cortex-X5コアにピン止めすることで2〜7%のデコード速度向上と、最適化されたGDNステートプールを実現。
  • 柔軟なコンテキスト: 262Kのネイティブコンテキストサポートに加え、YaRNを用いて最大100万トークンまで拡張可能。
  • 自動デプロイ: 再実行可能(idempotent)な起動/停止スクリプトと、DFlash2サポート用の自動Dockerイメージビルドを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト