syv-ai/qwen38-27b-rtx3090

Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

解决的问题

本项目为单张消费级NVIDIA RTX 3090(24 GB VRAM)上的Qwen3.8-27B模型提供高度优化的推理部署方案。通过采用先进的量化、推测解码和内存管理技术,解决了在有限硬件上实现高吞吐量和低延迟运行大模型的挑战。

工作原理

系统以vLLM为基础,应用多层优化策略:

  • 量化:将嵌入矩阵和LM头重新量化为int8/int4,释放VRAM并提升速度。
  • 推测解码:支持多种推测模式,包括MTP(多标记预测)和DFlash2,每步可预测多个标记以加速生成。
  • 上下文管理:实现前缀缓存,避免重复处理文档,并通过KVarN 4/2-bit KV缓存支持高达240k标记的扩展上下文窗口。
  • 运行模式:提供两种不同配置:面向高吞吐API后端的“批量”模式,以及面向低延迟聊天的“单用户”模式。

适用人群

拥有单张RTX 3090并希望以生产级性能、大上下文窗口和OpenAI兼容API运行Qwen3.8-27B的开发者和AI研究人员。

核心亮点

  • 高吞吐量:批量模式下最高可达约1,035 tokens/秒。
  • 低延迟:使用DFlash2推测模式的单用户模式下,可达到120+ tokens/秒。
  • 超大上下文:通过KVarN集成,支持高达240k tokens的上下文。
  • 无损推测:推测解码完全准确,保持原始模型的分布。
  • OpenAI兼容:提供支持可选密钥认证的API。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目