MiaAI-Lab/Qwen3.8-27B-SGLang-DGX-Spark
Qwen3.8 27B on SGLang for DGX Spark
解決的問題
此專案提供一組經過優化的、可立即執行的 Docker 腳本,可在 NVIDIA DGX Spark(GB10)硬體上提供 Qwen3.8-27B 模型的服務。它透過提供針對不同預測性解碼引擎的預先測量配置,消除了手動調校的猜測過程,確保在此特定架構上達到最大吞吐量與穩定性。
如何運作
此程式庫使用 SGLang 作為推論引擎,並以 Docker 容器包裝。它根據所使用的預測性解碼方法,提供三種不同的服務模式來加速詞元生成:
- EAGLE/MTP:使用檢查點內的頭部進行預測性解碼。
- DSpark:採用獨立的草稿模型來加速程式碼與一般對話。
- DFlash2:使用區塊差異化草稿模型(需透過提供的補丁自行建構映像檔)來優化程式碼與長篇寫作。
為了在 GB10 的 ARM 架構上最大化效能,這些腳本將程序固定在高性能的 Cortex-X5 核心上,並使用 FP8 KV 快取以節省記憶體。同時也支援透過 YaRN 擴展至最多 100 萬詞元的上下文視窗。
適用對象
使用 NVIDIA DGX Spark(GB10)硬體,希望在不手動調整 SGLang 標記與記憶體比例的情況下,以最佳效能部署 Qwen3.8-27B 的開發人員與研究人員。
主要特色
- 三種預測性引擎:支援 MTP、DSpark 與 DFlash2,各自針對不同工作負載進行調校(例如 DSpark 適用於程式碼,MTP 適用於長篇論文)。
- 硬體特定調校:固定於 Cortex-X5 核心,解碼速度提升 2-7%,並優化 GDN 狀態池。
- 彈性上下文:原生支援 262K 上下文,並可選透過 YaRN 擴展至 1M 詞元。
- 自動化部署:提供冪等的啟動/停止腳本,以及自動建構 DFlash2 支援的 Docker 映像檔。
相關
- 專案
- 專案
- 專案
- 專案
- 專案