vllm-project/speculators
A unified library for building, evaluating, and storing speculative decoding algorithms for LLM inference in vLLM
해결하는 문제
Speculators는 대규모 언어 모델(LLM) 추론의 높은 지연 시간 문제를 해결합니다. 이 라이브러리는 "드래프트 모델"(스펙큘레이터)을 훈련하기 위한 프로덕션 준비 완료된 프레임워크를 제공하여, 더 큰 베이스 모델이 단일 패스로 검증할 수 있도록 미리 여러 토큰을 예측할 수 있게 합니다. 이로써 메인 모델이 수행해야 하는 고비용의 포워드 패스 수를 줄이되, 최종 출력 품질은 손상되지 않습니다.
작동 방식
이 라이브러리는 이러한 드래프트 모델을 생성하는 엔드투엔드 프로세스를 표준화합니다. vLLM을 사용하여 훈련 데이터(은닉 상태)를 생성하고, 다양한 알고리즘을 사용해 드래프트 모델을 훈련하며, vLLM 추론 서버에 직접 배포할 수 있습니다. 단일 및 다중 레이어 모델을 포함한 여러 훈련 아키텍처를 지원하며, MoE, 비-MoE, 시각 언어 모델과도 호환됩니다.
대상 사용자
프로덕션 환경에서 LLM 배포를 가속화하고자 하는 AI 엔지니어 및 연구자들을 위한 것입니다.
주요 특징
- vLLM 직접 통합: Speculators로 훈련된 모델은
vllm serve를 사용해 원활하게 배포할 수 있습니다. - 다양한 알고리즘 지원: EAGLE-3, DFlash, DSpark, P-EAGLE 훈련 알고리즘을 지원합니다.
- 멀티노드 온라인 훈련: 공유 파일 시스템 또는 분산 저장소를 통해
hs_connectors를 사용해 여러 노드 간 온라인 훈련을 지원합니다. - 유연한 모델 지원: Llama, Qwen, Gemma, NVIDIA Nemotron 등 다양한 아키텍처와 호환됩니다.
- MTP 파인튜닝: 도메인 특화 데이터 위에서 네이티브 멀티토큰 예측 헤드의 파인튜닝을 지원합니다.
관련
- 프로젝트
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트