EAGLE-3 在 AMD Instinct GPU 上的推测解码
EAGLE-3 在 AMD Instinct GPU 上的推测解码
vLLM 和 AMD Quark 团队在 AMD Instinct GPU 上推出了 EAGLE-3 推测解码的端到端管道,使大型混合专家(MoE)和注意力密集型模型能够实现无损推理加速。此集成在 AMD Instinct MI355X GPU 上实现了 Kimi-K2.5 的吞吐量提升范围为 1.69x 到 2.00x,MiniMax-M2.5 的吞吐量提升范围为 1.38x 到 1.79x。
推测解码及 EAGLE-3 方法
推测解码是一种无损加速技术,可减少昂贵目标模型解码迭代的次数。与逐个生成 token 不同,轻量级草稿模型会提出多个未来 token,目标模型随后在一次前向传递中验证这些 token。与目标模型分布匹配的 token 会被接受,生成将从第一个被拒绝的 token 继续。
EAGLE-3 通过利用目标模型的多层特征,改进了之前的版本。EAGLE-3 不使用无关的小型语言模型,而是训练一个与目标模型紧密对齐的草稿模块,利用低级、中级和高级语义特征来提高草稿的接受率和整体推理速度。
AMD Quark MXFP4 量化
为了解决大型 MoE 模型在内存带宽和容量方面的限制,AMD Quark 团队使用 MXFP4(OCP Microscaling 4-bit 浮点)格式为主流 LLM 提供“day-0”量化。
MXFP4 实现的关键技术细节包括:
- 硬件加速:AMD Instinct MI350 系列 GPU(MI350X/MI355X)提供原生 FP4 矩阵加速。
- 内存效率:MXFP4 将 4-bit 元素分组到具有共享缩放因子的小块中,在减少内存占用的同时保持优于 INT4 的数值行为。
- vLLM 集成:这些检查点通过 FP4 ASM GEMM 路径(
VLLM_ROCM_USE_AITER_FP4_ASM_GEMM=1)和 AITER MoE 内核在 ROCm 上被 vLLM 消费。
以 vLLM 为中心的 EAGLE-3 训练管道
训练高接受率的草稿模型被视为一个系统问题,vLLM 作为训练循环的核心,贯穿五个阶段:
- 策略内数据合成:vLLM 提供 AMD Quark MXFP4 目标模型,使用精确的服务聊天模板生成响应,以确保训练与部署的一致性。
- 隐藏状态提取:vLLM 的隐藏状态提取钩子直接从运行中的目标引擎暴露辅助层(低级、中级和高级隐藏状态以及
fc_norm)。这支持在线、离线和流式模式,后者使得在单个节点上可以训练 420B MXFP4 MoE 目标模型。 - 冷启动 FSDP2 训练:单层 EAGLE-3 草稿头在 FSDP2 下从零开始训练,使用训练时测试(TTT)损失和位置衰减权重。
- 循环内服务-评估:当前检查点会定期导出并在 vLLM 推测解码下服务,以测量真实的接受长度,确保所选检查点针对生产引擎进行了优化。
- 导出与部署:最终的草稿导出为 Hugging Face 格式,并通过 vLLM-ROCm 进行部署。
草稿质量与上下文缩放
在 SPEED-Bench 上的评估表明,MiniMax-M3 EAGLE-3 草稿在 11 个领域中的平均接受长度(AL)为 2.77。最高的接受率出现在结构化技术内容中:
- 编码:3.16 AL
- 数学:3.12 AL
- RAG:3.11 AL
- 多语言:3.07 AL
值得注意的是,随着提示长度从 1K 增加到 32K 个 token(2.64 到 2.63),接受长度保持稳定,表明在长上下文中加速不会衰减。
AMD Instinct MI355X 上的性能基准
在 AMD Instinct MI355X(TP=4)上使用 1K 输入和 1K 输出 token(1K/1K)进行的基准测试表明,相较于非推测基线,吞吐量显著提升:
Kimi-K2.5 结果
- BF16 草稿路径:吞吐量提升 1.69x 至 1.90x。
- AMD Quark FP8 草稿路径:吞吐量提升 1.76x 至 2.00x。
MiniMax-M2.5 结果
- BF16 草稿路径:吞吐量提升 1.38x 至 1.79x。
在两种模型中,性能提升在较低的并发级别时最为显著。