vllm-project/speculators
A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM
What it solves
Speculators는 출력 품질을 잃지 않고 대규모 언어 모델(LLM) 추론을 가속화하기 위해 설계된 라이브러리입니다. 이는 더 큰 base model이 제안된 토큰을 검증하는 "draft models"(speculators)를 학습시킴으로써 수행됩니다. 투기적 디코딩(speculative decoding)이라고 알려진 이 프로세스는 base model이 토큰을 하나씩 생성하는 대신 한 번의 포워드 패스에서 여러 토큰을 검증할 수 있게 하여 지연 시간을 줄입니다.
How it works
이 라이브러리는 이러한 초안 모델을 학습시키기 위한 엔드투엔드 프레임워크를 제공합니다. EAGLE-3, P-EAGLE(단일 패스에서 여러 토큰을 예측), DFlash(anchored-block drafting 사용)를 포함한 여러 고급 알고리즘을 지원합니다. 또한 vLLM을 사용하여 verifier model에서 hidden states를 추출하여 오프라인 학습 데이터를 생성하거나, 실시간 hidden extraction 시스템을 통해 온라인 학습을 수행할 수 있습니다. 학습된 모델은 Hugging Face-compatible 형식으로 저장되며 vLLM 추론 서버에 직접 배포하여 프로덕션 환경에서 사용할 수 있습니다.
Who it’s for
프로덕션 환경에서 LLM 서빙 지연 시간을 최적화하고자 하는 ML 엔지니어 및 연구자, 특히 vLLM을 추론 엔진으로 사용하는 분들을 대상으로 합니다.
Highlights
- Direct vLLM Integration: Speculators로 학습된 모델은
vllm serve명령어를 사용하여 원활하게 서빙할 수 있습니다. - Diverse Algorithm Support: EAGLE-3, P-EAGLE, DFlash, 및 Multi-Token Prediction (MTP) 파인튜닝을 지원합니다.
- Flexible Training: 필요한 hidden states를 생성하기 위해 오프라인 및 온라인 학습 모드를 모두 제공합니다.
- Broad Model Support: Llama, Qwen3, gpt-oss, 및 Gemma 4와 호환되며, MoE 및 Vision Language 모델을 포함합니다.
- Memory Efficiency: DFlash 및 DSpark speculators를 위해 슬라이딩 윈도우 어텐션을 구현하여 긴 시퀀스에 대한 KV cache 할당을 줄입니다.