blazux/qwen3.8-Flash-DGX
recipe for running Qwen3.8-Flash-Next on a single DGX Spark
解決的問題
本專案使 Qwen3.8-Flash-Next 模型(約 176B 參數)能在單一 NVIDIA DGX Spark / ASUS GX10 系統上部署。特別針對模型的 NVFP4 檢查點(約 125 GiB)與必要 KV 快取合併後,超出可用 128 GB 統一記憶體池的記憶體限制問題。同時也修復 vLLM 中與前綴快取及 GB10 硬體上非決定性解碼相關的關鍵錯誤。
工作原理
- 透過 NVMe mmap 加載權重:為節省記憶體,專案修改 vLLM,將大型 n-gram 嵌入(PLE)表從 NVMe 透過
mmap提供,而非保留在 RAM 中,使常駐權重從約 125 GiB 降至約 75 GiB。 - 自訂修補程式:對官方 vLLM 鏡像套用 12 個以上的修補程式,修復前綴快取(Mamba 狀態錯誤)、稀疏注意力中的非決定性 top-k 及工具呼叫解析錯誤。
- 混合檢查點:提供可選的混合佈局(NVFP4 專家 + fp8 側層),可將解碼速度提升約 20%。
- 優化部署:使用
flashCLI 工具管理 Docker 建置、權重下載(透過 Xet)及部署設定(如speed、context、default)。
適用對象
- 使用 NVIDIA DGX Spark 或 ASUS GX10 硬體,希望在單一機器上以高達 500k–1M 令牌的上下文運行大型 Qwen 模型的開發者與研究人員。
主要亮點
- 記憶體效率:將權重佔用降至約 75 GiB,為大型 KV 快取(約 680k 令牌)騰出空間。
- 高性能量:在 GX10 上實現約 34 tok/s 的單串流解碼速度,預填入速度達約 2,500–2,800 tok/s。
- 決定性輸出:內建自訂決定性核心,確保一致的貪婪解碼,且不犧牲預填入速度。
- 可靠的工具解析:實作防護機制,防止模型在程式碼區塊內文件語法時意外觸發工具呼叫。
- 簡易部署:提供簡化的
./flash命令,用於快速設定、健康檢查與服務啟動。
相關
- 專案
- 專案
- 專案
- 專案