Speculators v0.5.0 릴리스 노트 / 새로운 기능
Speculators v0.5.0 릴리스 노트 / 새로운 기능
Speculators v0.5.0은 단일 패스 드래프트 토큰 생성을 위한 DFlash 알고리즘 지원을 도입하고, vLLM의 네이티브 히든 스테이트 추출 시스템을 통해 온라인 및 오프라인 학습 워크플로를 통합합니다. 이러한 업데이트는 학습 유연성을 향상시키고, 추측 디코딩 오버헤드를 줄이며, 추측 디코딩 워크플로의 프로덕션 준비성을 높입니다.
DFlash 알고리즘 지원
Speculators v0.5.0은 블록 확산을 사용하여 단일 순전파로 모든 드래프트 토큰을 생성하는 추측 디코딩 알고리즘인 DFlash에 대한 학습 지원을 추가합니다. 이는 Eagle 3와 같은 자기회귀 모델과 다릅니다. Eagle 3는 드래프트 토큰을 생성하기 위해 여러 번의 순전파가 필요합니다.
DFlash의 주요 기술적 특성은 다음과 같습니다:
- 단일 패스 생성: DFlash는 각 접두사에 대해 길이 B의 토큰 블록을 생성하여 더 긴 드래프트 시퀀스에 대한 오버헤드를 줄입니다.
- 비인과적 주의: 블록 내부에서 쿼리는 특정 주의 마스크를 사용하여 동일한 블록 내의 모든 다른 토큰에 주의할 수 있습니다.
- 최적화된 학습 앵커: 주의 마스크가 지나치게 커져 과도한 메모리/컴퓨팅을 소비하는 것을 방지하기 위해, DFlash는 시퀀스의 모든 지점에서 예측 블록을 시작하지 않습니다. 대신, 학습 손실에 기여하는 더 작은 "앵커" 위치 세트를 무작위로 선택하고, 예측 블록을 이들 앵커에만 연결합니다.
DFlash 스펙큘레이터 학습
DFlash 모델 학습은 Eagle 3와 유사한 온라인 워크플로를 따르지만 특정 매개변수가 필요합니다. 학습 명령어는 torchrun을 사용하며 다음과 같은 DFlash 전용 플래그를 포함합니다:
--speculator-type dflash: 알고리즘을 지정합니다.--block-size: 각 확산 블록당 생성되는 토큰 수를 정의합니다.--max-anchors: 학습 중 추측을 위한 최대 앵커 포인트 수를 설정합니다.
Gemma 4 DFlash 성능
새로운 DFlash 지원을 사용하여 Gemma 4 31B DFlash 스펙큘레이터를 학습했습니다. 다양한 작업에서의 평가는 특히 추론 및 코드 생성에서 강력한 성능을 보여줍니다.
성능 벤치마크에 따르면, Gemma 4 DFlash는 Eagle 3 및 독립형 FP8 양자화된 검증자보다 더 나은 인터-토큰 지연 시간을 달성합니다. FP8 양자화된 검증자와 결합할 때 인터-토큰 지연 시간 향상이 더욱 증가합니다.
vLLM 통합 및 서빙
DFlash 모델은 PR #38300를 통해 vLLM의 추측 디코딩 인프라에 통합되며, vllm>=0.20.0에서 지원됩니다.
모델은 대상 모델과 추측 알고리즘을 지정하는 config.json 파일에 speculators_config를 포함합니다.これにより DFlash 모델은 표준 vllm serve 명령어로 서빙할 수 있습니다:
vllm serve -tp 2 RedHatAI/gemma-4-31B-it-speculator.dflash
온라인 및 오프라인 학습 통합
Speculators v0.5.0은 vLLM v0.18.0에서 도입된 vLLM의 네이티브 히든 스테이트 추출 시스템으로 마이그레이션합니다.これにより 이전의 저수준 유틸리티를 대체하고 vLLM을 직접적인 Python 의존성에서 제거하여 학습 파이프라인을 vLLM의 내부 API로부터 분리합니다.
학습 모드
온라인 및 오프라인 학습은 이제 동일한 vLLM 기반 추출 경로를 사용합니다:
- 온라인 학습: 학습 중에 히든 스테이트가 실시간으로 추출됩니다. 이 과정은 vLLM 서버에 프롬프트를 보내고, 히든 스테이트를 디스크 또는 RAM 디스크에 추출하여 학습에 로드한 후 파일을 삭제하는 것을 포함합니다.
- 오프라인 학습: 학습 시작 전에 히든 스테이트가 사전 생성되어 디스크에 캐시됩니다.
이러한 모드는紧密하게 결합되어 있어 조합하여 사용할 수 있습니다. 사용자는 오프라인에서 히든 스테이트를 부분적으로 생성하고 온라인 학습 중에 로드하거나, 파일을 삭제하지 않고 온라인 학습을 실행하여 이후 에포크에서 재사용할 수 있습니다.
네이티브 추출 시스템을 활용하여 Speculators는 하드웨어 가속 및 효율적인 배치 전략과 같은 vLLM의 추론 최적화를 상속받으며, 표준 REST API를 통해 vLLM 서버와 통신합니다.
문서 업데이트
이 릴리스에는 다음과 같은 기능을 갖춘 업데이트된 문서 사이트가 포함됩니다:
- 지원되는 추측 디코딩 알고리즘 소개
- 스펙큘레이터 모델 학습을 위한詳細한 튜토리얼 워크스루
- 라이브러리에 새로운 추측 디코딩 알고리즘을 추가하기 위한 개발자 가이드
- 포괄적인 API 참조