weicj/vLLM-2080Ti-Definitive
The definitive vLLM runtime for dual RTX 2080 Ti 22GB + NVLink, delivering Qwen 27B local inference with maximum 100+ tok/s single-request decode with support of FP8 weight ( Join Discord :https://discord.gg/VFqVVySdMS )
해결하는 문제
이 프로젝트는 22GB 메모리 수정된 NVIDIA RTX 2080 Ti GPU(75 SM) 2개를 전용으로 최적화한 vLLM 런타임을 제공합니다. 이로 인해 Qwen3.x 27B/35B 및 Gemma4 31B와 같은 대규모 언어 모델(LLM)을 오래된 Turing 아키텍처 하드웨어에서 실행할 수 있게 되어, 이 GPU들을 개인 에이전트 유형 워크로드를 위한 고성능 추론 플랫폼으로 전환합니다.
작동 방식
SM75 아키텍처에 특화된 vLLM의 하드웨어 중심 포크로, Marlin, FlashQLA/FlashInfer, TurboQuant/INT8 KV, MTP(다중 토큰 예측) 등을 활용하여 처리량과 컨텍스트 창 크기를 최적화합니다. 모델 가중치와 KV 캐시 정밀도에 따라 품질과 성능의 균형을 맞추기 위해 사전 검증된 '프로파일'(예: 안전, 일반, 빠름, 공격적)을 제공합니다.
대상 사용자
NVLink 또는 PCIe P2P를 지원하는 2개의 RTX 2080 Ti 22GB GPU를 사용하며, 예산 친화적이고 중고 시장에서 구할 수 있는 하드웨어 구성으로 27B-35B 클래스 모델을 대규모 컨텍스트 창(최대 256K)에서 실행하고자 하는 AI 애호가 및 개발자.
주요 특징
- 하드웨어 최적화: NVLink 지원 2개의 RTX 2080 Ti 22GB(TP=2)에 특화.
- 고처리량: 검증된 Qwen3.6 27B FP8 경로로 단일 요청 디코딩 시 100+ 토큰/초 달성.
- 광범위한 컨텍스트 지원: Qwen3.x 27B는 네이티브 256K 컨텍스트, Qwen3.x 35B는 136K-178K를 지원.
- 통합 도구 제공: 자동 환경 설정을 위한
build.sh스크립트와 프로파일 적용 및 서버 관리를 위한launcher.sh인터랙티브 서비스 매니저 포함. - 다양한 모델 지원: Qwen3.x(27B/35B)에 대한 검증된 경로와 Gemma4 31B에 대한 실험적 지원 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch