weicj/vLLM-2080Ti-Definitive
The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with maximum 100+ tok/s single-request decode with support of FP8 weight ( Join Discord :https://discord.gg/VFqVVySdMS )
解决的问题
本项目提供一个专为双 NVIDIA RTX 2080 Ti GPU(SM75)且配备 22GB 内存改造的硬件量身定制的 vLLM 运行时。它使用户能够在较旧的 Turing 架构硬件上运行 Qwen3.x 27B/35B 和 Gemma4 31B 等大型语言模型(LLM),将这些 GPU 转变为适用于个人代理类工作负载的高性能推理平台。
工作原理
这是 vLLM 的一个以硬件为中心的分支,集成了多个专为 SM75 架构优化的加速内核和补丁。通过使用 Marlin、FlashQLA/FlashInfer、TurboQuant/INT8 KV 和 MTP(多标记预测)来优化吞吐量和上下文窗口大小。项目包含一组经过预验证的“配置文件”(例如:安全、正常、快速、激进),用于根据特定模型权重和 KV 缓存精度配置运行时,以平衡质量与性能。
适用人群
使用双 RTX 2080 Ti 22GB GPU(支持 NVLink 或 PCIe P2P)并希望在预算友好、二手市场可获取的硬件配置上,以大上下文窗口(最高达 256K)运行 27B-35B 类模型的 AI 爱好者和开发者。
主要亮点
- 硬件优化:专为支持 NVLink 的双 RTX 2080 Ti 22GB(TP=2)优化。
- 高吞吐量:经验证的 Qwen3.6 27B FP8 路径,单请求解码达到 100+ tokens/秒。
- 广泛上下文支持:Qwen3.x 27B 原生支持 256K 上下文,Qwen3.x 35B 支持 136K–178K。
- 集成工具链:包含
build.sh脚本用于自动化环境搭建,以及launcher.sh交互式服务管理器,便于应用配置文件和服务器管理。 - 广泛模型支持:已验证支持 Qwen3.x(27B/35B),并提供 Gemma4 31B 的实验性支持。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch