sgl-project/SpecForge
Train speculative decoding models effortlessly and port them smoothly to SGLang serving.
무엇을 해결하는가
SpecForge는 speculative decoding 모델을 위한 잘 관리되고 호환 가능한 훈련 프레임워크의 부족 문제를 해결합니다. 이 프레임워크는 이러한 모델들을 표준화된 방식으로 훈련할 수 있게 하여, LLM 추론 속도를 가속화하기 위해 SGLang 서빙 프레임워크로 원활하게 이식될 수 있도록 합니다.
작동 방식
SpecForge는 YAML 파일을 통해 사용자가 다양한 drafting methods와 배포 토폴로지를 구성할 수 있는 통합된 타입 지정 훈련 엔트리 포인트를 사용합니다. 온라인 disaggregated training과 colocated 및 disaggregated offline training을 모두 포함한 여러 훈련 모드를 지원합니다. 이 프레임워크는 훈련 프로세스를 최적화하기 위해 다양한 data, tensor, sequence parallel 토폴로지를 지원합니다.
대상 사용자
LLM의 추론 성능을 향상시키기 위해 speculative decoding draft 모델을 훈련하고자 하는 개발자와 연구자, 특히 SGLang 서빙 프레임워크를 사용하는 사용자를 위해 설계되었습니다.
주요 특징
- SGLang 호환성: SpecForge로 훈련된 모델은 SGLang에서 작동하기 위해 추가적인 이식 노력이 필요하지 않습니다.
- 다양한 Drafting Methods: EAGLE3, P-EAGLE, DFlash, DFlash2, Domino, DSpark를 포함한 광범위한 기술을 지원합니다.
- 유연한 훈련 토폴로지: colocated 또는 disaggregated 설정 옵션을 제공하는 온라인 및 offline 훈련을 지원합니다.
- SpecBundle: 즉시 사용할 수 있는 프로덕션급의 사전 훈련된 speculative decoding 모델 모음인 SpecBundle을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch