vLLM, Speculators, 및 LLM Compressor를 사용한 Laguna XS.2 추론 최적화
vLLM, Speculators, 및 LLM Compressor를 사용한 Laguna XS.2 추론 최적화
Poolside와 Red Hat AI는 고성능 에이전트 코딩 및 장기 소프트웨어 작업을 위해 Laguna XS.2 모델을 최적화했습니다. Laguna XS.2를 vLLM에 통합하고 DFlash 추측 디코딩 및 LLM Compressor 양자화를 구현함으로써, 팀은 생성 품질을 희생하지 않으면서 추론 지연을 줄이고 운영 효율성을 높였습니다.
일급 vLLM 통합
Laguna XS.2는 일급 시민으로서 vLLM에 직접 통합됩니다. 이 통합을 통해 개발자는 표준 vLLM API를 사용하여 모델을 즉시 배포할 수 있으며, 기존 생산 추론 파이프라인과의 원활한 호환성을 보장합니다.
DFlash 추측 디코딩을 사용한 추론 가속
Red Hat AI는 Speculators 라이브러리를 사용하여 Laguna XS.2용 DFlash 스펙큘레이터를 훈련시켰으며, 이로 인해 생성 품질 손실 없이 토큰 생성 속도가 2-3배 증가했습니다.
DFlash의 기술적 구현
DFlash 알고리즘은 대상 Laguna XS.2 모델의 숨은 상태 입력을 사용하여 작은 5층, 0.6B 드래프트 모델이 토큰 블록을 예측할 수 있게 합니다. 이러한 예측된 토큰은 Laguna XS.2에서 단일 순전파로 검증됩니다. 토큰이 받아들여지면, 표준 자기회귀 생성보다 훨씬 빠르게 생성됩니다. 이 검증 과정은 출력 품질이 대형 모델만을 사용할 때와 동일하게 유지됨을 보장합니다.
훈련 방법론
- 데이터세트: Ultrachat 200k SFT와 Magpie-Align에서 500k 샘플. 프롬프트는 샘플링되고 응답은 thinking이 활성화된 Laguna XS.2에서 재생성되었습니다.
- 훈련 기간: 코사인 스케줄러를 사용하여 6 에포크.
- 학습률: 최대 학습률 6e-4.
- 시퀀스 길이: 8192.
- 샘플링: 각 시퀀스에 대해 3072 블록 위치가 무작위로 샘플링되었습니다.
이 구성은 5층 드래프트 모델이 한 번의 순전파로 8개의 토큰을 예측할 수 있게 하여, Eagle-3 패러다임을 넘어선 병렬 드래프팅을 통해 토큰 간 지연을 줄입니다.
LLM Compressor 양자화를 통한 효율적인 배포
다양한 하드웨어 및 메모리 요구 사항을 지원하기 위해, Poolside는 compressed-tensors 형식의 LLM Compressor 라이브러리를 사용하여 Laguna XS.2의 양자화된 체크포인트를 공개했습니다. 사용 가능한 변형은 다음과 같습니다:
- FP8
- NVFP4
- INT4/INT8
이 양자화된 체크포인트는 개발자가 vLLM 내에서 모델 품질을 유지하면서 하드웨어 활용도, 지연 시간, 메모리 소비 사이의 균형을 최적화할 수 있게 합니다.