EAGLE 3.1 发布说明:提升推测解码的鲁棒性和效率
EAGLE 3.1 发布说明:提升推测解码的鲁棒性和效率
EAGLE 3.1 是对推测解码框架的重大更新,旨在提升鲁棒性、效率和可部署性。通过解决“注意力漂移”,该更新相较于 EAGLE 3 在长上下文工作负载中实现了最长可接受长度提升至 2 倍。
通过架构改进解决注意力漂移
EAGLE 3.1 解决了一种称为“注意力漂移”的性能下降现象,即随着推测深度的增加,草稿模型会将注意力从目标标记转移到其自身生成的标记上。这种不稳定性由两个主要因素导致:融合输入表示不平衡,使得高层隐藏状态占主导,以及由于未归一化的残差路径导致隐藏状态幅度不断增大。
为缓解这些问题,EAGLE 3.1 实施了两项关键的架构改动:
- FC Normalization(FC 归一化): 在每个目标隐藏状态之后、FC 层之前添加全连接(FC)归一化。
- Post-Norm Hidden-State Feedback(后归一化隐藏状态反馈): 将后归一化的隐藏状态馈入后续的解码步骤。
这些修改使草稿模型的行为更接近于在解码步骤之间进行递归调用,而不是简单地向目标模型添加层。由此带来对聊天模板和系统提示变化的更高韧性、更强的长上下文鲁棒性,以及从训练阶段到推理阶段的更好外推能力。
通过 TorchSpec 与 vLLM 进行训练和部署
EAGLE 3.1 通过与 TorchSpec 和 vLLM 的合作,集成到 AI 生态系统中,以简化从研究到生产的路径。
TorchSpec 训练支持
TorchSpec 现在为 EAGLE 3.1 提供高效的训练支持,降低训练开销并简化实验工作流。作为该流水线的示例,已开源了针对 Kimi K2.6 的 EAGLE 3.1 草稿模型。
vLLM 集成
EAGLE 3.1 被实现为 vLLM 中现有 EAGLE 3 实现的基于配置的扩展。该集成包括对 FC 归一化、后归一化隐藏状态反馈的支持,以及移除对目标隐藏状态的硬编码假设。
对 EAGLE 3 检查点的向后兼容性得到完整保留,允许将草稿模型直接接入现有的推测解码代码路径。此支持已在 vLLM 主分支、夜间构建以及即将发布的 v0.22.0 版本中提供。
性能基准
在 SPEED-Bench 编码数据集上使用 Kimi K2.6 EAGLE 3.1 草稿模型(在 Kimi-K2.6-NVFP4 上运行,使用 vLLM,TP=4,GB200,非拆分)进行的基准测试显示出显著的吞吐量提升:
- Concurrency 1(并发 1): 相比无推测基线,每用户输出吞吐量提升 2.03 倍。
- Concurrency 4(并发 4): 吞吐量提升 1.71 倍。
- Concurrency 16(并发 16): 吞吐量提升 1.66 倍。
生态系统合作
EAGLE 3.1 的开发是 EAGLE 团队(算法研究)、vLLM 团队(生产推理优化)和 TorchSpec 团队(训练基础设施)之间的共同努力,GPU 支持由 NVIDIA 提供。