syv-ai/qwen38-27b-rtx3090
Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks
解決的問題
本專案為單張消費級NVIDIA RTX 3090(24 GB VRAM)上的Qwen3.8-27B模型提供高度優化的服務設定。透過採用先進的量化、推測解碼與記憶體管理技術,解決在有限硬體上實現高吞吐量與低延遲運行大型模型的挑戰。
工作原理
系統以vLLM為基礎,並應用多層優化策略:
- 量化:將嵌入矩陣與LM頭重新量化為int8/int4,釋放VRAM並提升速度。
- 推測解碼:支援多種推測模式,包括MTP(多標記預測)與DFlash2,每步可預測多個標記以加速生成。
- 上下文管理:實作前綴快取,避免重複處理文件,並透過KVarN 4/2-bit KV快取支援最高達240k標記的擴展上下文視窗。
- 運行模式:提供兩種不同設定:面向高吞吐API後端的「批次」模式,以及面向低延遲聊天的「單使用者」模式。
適用對象
擁有單張RTX 3090,並希望以生產級效能、大上下文視窗與OpenAI相容API運行Qwen3.8-27B的開發者與AI研究人員。
核心亮點
- 高吞吐量:批次模式下最高可達約1,035 tokens/秒。
- 低延遲:使用DFlash2推測模式的單使用者模式下,可達120+ tokens/秒。
- 超大上下文:透過KVarN整合,支援最高達240k tokens的上下文。
- 無損推測:推測解碼完全準確,保持原始模型的分佈。
- OpenAI相容:提供支援可選金鑰驗證的API。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案