1CatAI/1Cat-vLLM
V100 / SM70-focused vLLM engineering fork for modern LLM inference.
해결하는 문제
1Cat-vLLM는 현대 대규모 언어 모델 시대에 테슬라 V100(SM70) GPU가 쇠퇴하지 않도록 설계된 vLLM의 전용 포크입니다. 표준 vLLM이 효율적이거나 호환되지 않을 수 있는 오래된 Volta 아키텍처 하드웨어에서, 특히 Qwen 계열의 AWQ 및 실험적 FP8 모델의 추론을 최적화합니다.
작동 방식
이 프로젝트는 V100에서 고성능 추론을 가능하게 하기 위해 여러 하드웨어 특화 최적화를 통합합니다.
- 사용자 정의 커널: TurboMind에서 유래한 SM70 커널과 디코딩 및 프리필 작업 모두에 사용 가능한 전용
FLASH_ATTN_V100백엔드를 포함합니다. - AWQ 지원: SM70에서 밀집형 및 MoE Qwen 모델에 대한 최적화된 4비트 AWQ 추론 경로를 제공합니다.
- 메모리 및 컨텍스트 관리: 최대 256K 컨텍스트까지 지원하는 긴 컨텍스트 추론을 위한 런타임 기본값을 포함하고, 멀티모달 입력에 대한 메모리 예산을 관리합니다.
- 추측적 디코딩: 특정 워크로드에 대해 MTP(Multi-Token Prediction) 추측적 디코딩을 옵션으로 지원합니다.
- 실험적 경로: FP8 모델, FP8 KV 캐시, DFlash에 대한 연구 수준의 지원을 포함합니다.
대상 사용자
Tesla V100 GPU를 계속 사용하면서 OpenAI 호환 API를 갖춘 현대적이고 고성능 LLM을 배포하고자 하는 개인 개발자, 스튜디오, 팀을 위한 것입니다.
주요 특징
- V100 최적화: 일반적인 포크가 아니라 SM70 아키텍처에 특화되어 있습니다.
- 긴 컨텍스트 기능: 메모리가 허용하는 한 공개 프로필의 기본값이 256K 컨텍스트입니다.
- 멀티모달 대응: SM70 경로에서는 기본적으로 이미지 입력을 지원합니다.
- OpenAI 호환성: Cherry Studio 및 OpenClaw와 같은 일반적인 OpenAI 스타일 클라이언트에서 검증되었습니다.
- 사전 빌드된 웨일: Ubuntu 24.04 및 CUDA 12.8용 사전 빌드된 웨일을 제공하여 설치가 간편합니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch