syv-ai/qwen38-27b-rtx3090

Qwen3.8-27B on a single RTX 3090 with vLLM: ~1,000 tok/s at 64 concurrent (int8 tensor-core GEMMs, fp16 DeltaNet state), ~114 tok/s single-user at default sampling / ~124 greedy (MTP drafts, own-output draft vocab, calibrated int4 lm_head, split-KV verify attention), 150k-262k context; patches, requant scripts, benchmarks

해결하는 문제

이 프로젝트는 단일 소비자용 NVIDIA RTX 3090(24GB VRAM)에서 Qwen3.8-27B 모델을 고도로 최적화된 서빙 환경으로 제공합니다. 제한된 하드웨어에서 높은 처리량과 낮은 지연 시간으로 대규모 모델을 실행하는 도전 과제를 해결하기 위해 고급 양자화, 추측 디코딩, 메모리 관리 기술을 적용합니다.

작동 방식

시스템은 vLLM을 기반으로 하며, 여러 수준의 최적화를 적용합니다.

  • 양자화: 임베딩 행렬과 LM 헤드를 int8/int4로 재양자화하여 VRAM을 확보하고 속도를 향상시킵니다.
  • 추측 디코딩: MTP(Multi-Token Prediction) 및 DFlash2와 같은 다양한 추측 모드를 제공하여 한 스텝당 여러 토큰을 예측하여 생성을 가속화합니다.
  • 컨텍스트 관리: 프리픽스 캐싱을 구현하여 문서 재처리를 방지하고, KVarN 4/2비트 KV 캐시를 통해 최대 240k 토큰의 확장된 컨텍스트 창을 지원합니다.
  • 운영 모드: 고처리량 API 백엔드를 위한 "배치" 모드와 낮은 지연 시간 채팅을 최적화한 "단일 사용자" 모드의 두 가지 구성이 제공됩니다.

대상 사용자

1대의 RTX 3090을 보유하고 있으며, Qwen3.8-27B를 프로덕션 수준의 성능, 대용량 컨텍스트, OpenAI 호환 API로 실행하고자 하는 개발자 및 AI 연구자.

주요 특징

  • 고처리량: 배치 모드에서 최대 약 1,035 토큰/초를 달성합니다.
  • 저지연: DFlash2 추측을 사용한 단일 사용자 모드에서 120 토큰/초 이상을 달성합니다.
  • 대용량 컨텍스트: KVarN 통합을 통해 최대 240k 토큰의 컨텍스트를 지원합니다.
  • 손실 없는 추측: 추측 디코딩은 정확하며 원본 모델의 분포를 유지합니다.
  • OpenAI 호환: 키 인증 옵션을 제공하는 API를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트