weicj/vLLM-2080Ti-Definitive

The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with maximum 100+ tok/s single-request decode with support of FP8 weight ( Join Discord :https://discord.gg/VFqVVySdMS )

何を解決するか

このプロジェクトは、22GBメモリ改造済みのNVIDIA RTX 2080 Ti GPU(SM75)2枚を搭載した環境に特化した、vLLMの最適化されたランタイムを提供します。これにより、Qwen3.x 27B/35BやGemma4 31Bといった大規模言語モデル(LLM)を、古いTuringアーキテクチャのハードウェア上で実行可能にし、個人エージェント型ワークロード向けの高性能推論プラットフォームへと変換します。

動作方法

vLLMのハードウェア中心のフォークであり、SM75アーキテクチャに特化して最適化された複数の加速カーネルとパッチを統合しています。Marlin、FlashQLA/FlashInfer、TurboQuant/INT8 KV、MTP(マルチトークン予測)を活用し、スループットとコンテキスト窓サイズを最適化します。特定のモデル重みとKVキャッシュ精度に応じて品質と性能のバランスを取るための、事前に検証済みの「プロファイル」(例:セーフ、ノーマル、ファスト、アグレッシブ)を複数用意しています。

対象ユーザー

NVLinkまたはPCIe P2P対応の2枚組RTX 2080 Ti 22GB GPUを搭載し、予算に優しく中古市場で入手可能なハードウェア構成で、27B~35Bクラスのモデルを大規模コンテキスト窓(最大256K)で実行したいAI愛好家や開発者。

主な特徴

  • ハードウェア最適化:NVLink対応の2枚組RTX 2080 Ti 22GB(TP=2)に特化。
  • 高スループット:検証済みのQwen3.6 27B FP8ルートで、単一リクエストデコード時に100トークン/秒以上を達成。
  • 広範なコンテキスト対応:Qwen3.x 27Bではネイティブ256Kコンテキスト、Qwen3.x 35Bでは136K~178Kをサポート。
  • 統合ツールキット:自動環境構築用の build.sh スクリプトと、プロファイル適用・サーバ管理を簡単に行える launcher.sh インタラクティブサービスマネージャを搭載。
  • 広範なモデル対応:Qwen3.x(27B/35B)の検証済みルートと、Gemma4 31Bの実験的サポートを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch