Laguna XS.2 使用 vLLM、Speculators 和 LLM Compressor 进行推理优化
Laguna XS.2 使用 vLLM、Speculators 和 LLM Compressor 进行推理优化
Poolside 和 Red Hat AI 将 Laguna XS.2 模型进行了优化,以适用于高性能的 agentic 编码和长时程软件任务。通过将 Laguna XS.2 集成到 vLLM 并实现 DFlash 推测解码和 LLM Compressor 量化,团队在不牺牲生成质量的前提下降低了推理延迟并提高了运营效率。
一流的 vLLM 集成
Laguna XS.2 作为一流公民直接集成到 vLLM 中。此集成使开发者能够使用标准 vLLM API 立即部署模型,确保与现有生产推理流水线的无缝兼容。
使用 DFlash 推测解码加速推理
Red Hat AI 使用 Speculators 库为 Laguna XS.2 训练了一个 DFlash 推测器,使得 token 生成速度提升了 2-3 倍,且生成质量没有损失。
DFlash 的技术实现
DFlash 算法使得一个小型的 5 层、0.6B 草稿模型能够使用目标 Laguna XS.2 模型的隐藏状态输入来预测一块 token。这些预测的 token 随后由 Laguna XS.2 在一次前向传递中进行验证。如果这些 token 被接受,它们的生成速度将显著快于标准自回归生成。此验证过程保证输出质量与仅使用大模型完全相同。
训练方法
- Datasets:来自 Ultrachat 200k SFT 和 Magpie-Align 的 500k 样本。提示被采样,响应从启用思考的 Laguna XS.2 重新生成。
- 训练时长:使用余弦调度器进行 6 个 epoch。
- 学习率:最大学习率为 6e-4。
- 序列长度:8192。
- 采样:对于每个序列,随机采样了 3072 个块位置。
此配置使得 5 层草稿模型能够在一次前向传递中预测 8 个 token,通过超越 Eagle-3 范式来减少 token 之间的延迟,从而实现更快的并行草稿。
通过 LLM Compressor 量化实现高效部署
为了支持多样化的硬件和内存需求,Poolside 使用 LLM Compressor 库以 compressed-tensors 格式发布了 Laguna XS.2 的量化检查点。可用的变体包括:
- FP8
- NVFP4
- INT4/INT8
这些量化检查点使开发者能够在 vLLM 中保持模型质量的同时,优化硬件利用率、延迟和内存消耗之间的平衡。