xiaol/wkvm
Inference for hybrid LLMs: Gemma, RWKV, and all kinds of hybrids.
해결하는 문제
WKVM은 선형 및 하이브리드 선형 모델(RWKV-7, GDN, Mamba2 등)을 위한 모델 상태용 하이퍼바이저입니다. 장문의 컨텍스트에서 메모리 소비가 큰 전통적인 페이지 기반 KV 블록 체인을 고정 크기의 요청별 상태 슬롯으로 대체합니다. 이로 인해 요청당 메모리 사용량이 일정하고 매우 작아지며, 스케줄링이 단순화되고 고급 상태 관리가 가능해집니다.
작동 방식
복잡한 KV 캐시를 관리하는 대신, WKVM은 모델 상태를 가상 머신으로 간주합니다. 각 요청에 대해 고정 크기의 상태 슬롯을 할당하여 엔진이 상태 생성, 스냅샷, 포크, 휴면, 재개 등의 작업을 수행할 수 있게 합니다. 하이브리드 모델의 경우, 전체 어텐션 레이어는 단순한 페이지 기반 게스트 풀에서 처리됩니다. "내구성 있는 상태 API"는 상태 핸들을 이름, 버전, 저장소 계층(GPU, 핀된 호스트 메모리, NVMe) 간에 공유할 수 있도록 지원합니다.
대상 사용자
재귀적 또는 선형 어텐션 모델을 다루며 고처리량 추론, 효율적인 상태 관리, 최소한의 메모리 오버헤드로 수천 개의 동시 세션을 처리할 수 있는 개발자 및 연구자에게 적합합니다.
주요 특징
- 상태 네이티브 추론: 상태를 이동, 포크, 휴면할 수 있는 1급 객체로 취급합니다.
- 내구성 있는 상태 API: GPU, 핀된 호스트 메모리, NVMe 등 다양한 저장소 계층에 저장 가능한 이름, 버전, 수정 가능한 상태 핸들을 지원합니다.
- 고처리량: 특정 선형/하이브리드 모델 워크로드에서 vLLM 및 SGLang보다 뚜렷한 처리량 향상을 보입니다.
- 효율적인 스케줄링: 무료 슬롯 수 기반 정확한 접근을 제공하는 단계 없는 연속 배치 스케줄러를 사용합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch