z-lab/dflash
DFlash: Block Diffusion for Flash Speculative Decoding
解决的问题
DFlash 通过实现更高效的推测解码方法,解决了大语言模型(LLM)逐 token 生成速度慢的问题。它能够实现高质量的并行草稿生成,从而减少目标模型生成响应所需的时间。
工作原理
使用轻量级块扩散模型作为草稿模型。该草稿模型并行预测多个 token,而非逐个预测,随后由目标 LLM 在单次遍历中进行验证。该系统支持多种后端,包括 Transformers、MLX(适用于 Apple Silicon)、以及 SGLang 和 vLLM 等兼容 OpenAI 的服务器。
适用人群
希望利用推测解码提升生成吞吐量并降低延迟的 LLM 推理开发者和研究人员。
主要亮点
- 并行草稿生成:利用块扩散技术同时生成多个 token 候选。
- 广泛的模型支持:兼容多种模型,包括 Qwen、Gemma、MiniMax、Kimi 和 Llama-3.1。
- 灵活的部署方式:可在不同硬件和软件栈上运行,包括 Mac 上的本地 MLX 以及服务器端的 vLLM/SGLang。
- 集成基准测试:内置工具,可用于在 GSM8K 和 HumanEval 等数据集上评估性能。
相关
- 项目
- Dispatch
- 项目
- Dispatch
- 项目