MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark

Qwen3.8-Flash-Next on ONE DGX Spark (TP=1)

何を解決するか

このプロジェクトは、Mia-AiLab/Qwen3.8-Flash-Next-NVFP4 ビジョン・ランゲージモデルを単一の DGX Spark マシン上で配信するための自己完結型のレシピとデプロイスクリプトを提供します。特に、99 GiB の大きなチェックポイントをマシンのユニファイドメモリに収める課題に取り組みつつ、テキスト、画像、動画処理の高性能を維持します。

動作方法

システムは vLLM を推論エンジンとして使用し、PLE テーブルをオフロードしてメモリマッピングすることでメモリ使用量を最適化します。以下のパフォーマンス最適化を採用しています:

  • 予測デコード:語彙数を削減したドラフト(drafter)と MTP(Multi-Token Prediction)を用いて、デコード速度を向上。
  • メモリ管理:システムの不安定化やメモリリークを防ぐために、ホスト側のメモリ制限(HOST_RESERVE_GIB)を実装。
  • KVキャッシュ最適化:FP8 KVキャッシュをサポートし、メモリ内に格納可能なトークン数を増加。
  • マルチモーダル対応:27層のビジョンタワーを統合し、OpenAI互換のAPI形状で画像および動画をそのまま処理可能。

対象ユーザー

DGX Sparkハードウェアにアクセスがある開発者や研究者で、最小限の設定オーバーヘッドで高性能なマルチモーダルビジョン・ランゲージモデルをデプロイしたい方。

主な特徴

  • マルチモーダル機能:テキスト、画像、動画(時間的順序認識を検証済み)のネイティブ対応。
  • 高スループット:特定の設定で、8つのストリームで合計 162.9 トークン/秒を達成。
  • 最適化されたプレフィル:PLEページフォールトプリフェッチ機構を含み、最初のトークンまでの時間(TTFT)を短縮。
  • 柔軟な設定:環境変数でコンテキスト長、予測深度、メモリ予算を簡単に調整可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト