MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark
Qwen3.8-Flash-Next on ONE DGX Spark (TP=1)
解決的問題
本專案提供一個自包含的部署方案與執行腳本,可在單一 DGX Spark 機器上部署 Mia-AiLab/Qwen3.8-Flash-Next-NVFP4 視覺-語言模型。特別針對將大型(99 GiB)檢查點適配至機器統一記憶體的挑戰,同時維持文字、影像與影片處理的高效率。
作法原理
系統使用 vLLM 作為推論引擎,將 PLE 表卸載並記憶體映射,以優化記憶體使用。採用多項效能最佳化技術,包括:
- 預測解碼:使用 MTP(多標記預測)與精簡詞彙量的草稿模型,提升解碼速度。
- 記憶體管理:實作主機端記憶體上限(
HOST_RESERVE_GIB),防止系統不穩定與記憶體洩漏。 - KV 快取優化:支援 FP8 KV 快取,增加記憶體中可儲存的標記數量。
- 多模態支援:整合 27 層視覺塔,透過 OpenAI 相容的 API 格式,原生支援影像與影片處理(時間順序辨識已驗證)。
適用對象
擁有 DGX Spark 硬體存取權限,希望以最小設定開銷部署高效率多模態視覺-語言模型的開發者與研究人員。
主要亮點
- 多模態功能:原生支援文字、影像與影片(時間順序辨識已驗證)。
- 高吞吐量:在特定設定下,8 個串流的總吞吐量可達 162.9 個標記/秒。
- 優化的預填入:內建 PLE 頁面錯誤預取機制,減少首次標記時間(TTFT)。
- 彈性配置:透過環境變數輕鬆調整上下文長度、預測深度與記憶體預算。
相關
- 專案
- 專案
- 專案
- 專案