weicj/vLLM-2080Ti-Definitive
The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with maximum 100+ tok/s single-request decode with support of FP8 weight ( Join Discord :https://discord.gg/VFqVVySdMS )
解決的問題
本專案提供一個專為雙 NVIDIA RTX 2080 Ti GPU(SM75)且具備 22GB 記憶體改造的硬體量身打造的 vLLM 執行環境。它讓使用者能在較舊的 Turing 架構硬體上執行 Qwen3.x 27B/35B 與 Gemma4 31B 等大型語言模型(LLM),將這些 GPU 轉化為適用於個人代理型工作負載的高效能推論平台。
作用方式
這是 vLLM 的一個以硬體為導向的分支,整合了多個專為 SM75 架構優化之加速核心與修補程式。透過使用 Marlin、FlashQLA/FlashInfer、TurboQuant/INT8 KV 與 MTP(多標記預測)來優化吞吐量與上下文視窗大小。專案包含一組預先驗證的「設定檔」(例如:安全、正常、快速、激進),可依特定模型權重與 KV 快取精度配置執行環境,以平衡品質與效能。
適用對象
使用雙 RTX 2080 Ti 22GB GPU(支援 NVLink 或 PCIe P2P)並希望在預算友善、二手市場可取得的硬體組態上,以大上下文視窗(最高達 256K)執行 27B-35B 類模型的 AI 愛好者與開發者。
主要亮點
- 硬體優化:專為支援 NVLink 的雙 RTX 2080 Ti 22GB(TP=2)優化。
- 高吞吐量:經驗證的 Qwen3.6 27B FP8 路徑,單一請求解碼達 100+ tokens/秒。
- 廣泛上下文支援:Qwen3.x 27B 原生支援 256K 上下文,Qwen3.x 35B 支援 136K–178K。
- 整合工具鏈:包含
build.sh指令碼用於自動化環境設定,以及launcher.sh互動式服務管理器,方便應用設定檔與伺服器管理。 - 廣泛模型支援:已驗證支援 Qwen3.x(27B/35B),並提供 Gemma4 31B 的實驗性支援。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch