z-lab/dflash
DFlash: Block Diffusion for Flash Speculative Decoding
해결하는 문제
DFlash는 대규모 언어 모델(LLM)의 토큰 단위 생성 속도 저하를 해결하기 위해 더 효율적인 추측적 디코딩 방법을 구현합니다. 이는 타겟 모델이 응답을 생성하는 데 걸리는 시간을 줄이기 위해 고품질의 병렬 드래프트 생성을 가능하게 합니다.
작동 방식
경량 블록 확산 모델을 드래프트 모델로 사용합니다. 이 드래프트 모델은 타겟 LLM이 단일 패스로 검증하는 동안 하나씩이 아니라 병렬로 여러 토큰을 예측합니다. 시스템은 Transformers, MLX(Apple Silicon용), SGLang 및 vLLM과 같은 OpenAI 호환 서버를 포함한 다양한 백엔드를 지원합니다.
대상 사용자
추측적 디코딩을 통해 생성 처리량을 높이고 지연 시간을 줄이고자 하는 LLM 추론 작업에 종사하는 개발자 및 연구자.
주요 특징
- 병렬 드래프트 생성: 블록 확산을 사용하여 여러 토큰 후보를 동시에 생성합니다.
- 광범위한 모델 호환성: Qwen, Gemma, MiniMax, Kimi, Llama-3.1 등 다양한 모델과 호환됩니다.
- 유연한 배포 가능성: Mac용 로컬 MLX 및 서버 측 vLLM/SGLang 등 다양한 하드웨어 및 소프트웨어 스택에서 작동합니다.
- 통합 벤치마킹: GSM8K 및 HumanEval과 같은 데이터셋에서 성능을 평가할 수 있는 내장 도구를 제공합니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트