LLM 推理的高效前沿:权衡与前沿突破的技术

TL;DR – LLM 推理中“高效前沿”的含义

高效前沿是 LLM 推理中的一个帕累托曲线,它捕捉了延迟、吞吐量(成本)以及有时质量之间的最佳可实现权衡。能够管理权衡的技术会将部署移动到该曲线上的不同点(例如,使用更大的批处理以提高吞吐量,使用更多的张量并行以降低延迟)。能够推动前沿的技术则改进底层硬件或软件栈,将整个曲线向外移动,使得任何一点都变得更便宜或更快。


管理权衡:如何针对前沿上的特定点进行优化

批处理大小

  • 影响: 更大的批处理会提高整体 token 吞吐量,但会增加单请求延迟;更小的批处理则相反。
  • 为何重要: 由于前沿曲线是锯齿状的,最优批处理大小通常只有在经过实证扫描后才会显现。

并行策略

  • 张量并行(TP): 将模型层复制到多个 GPU 上;尽管存在昂贵的全对全通信,但在延迟敏感的工作负载中表现出色。
  • 专家并行(EP): 一种折中方案——低度 EP 改善延迟,而宽 EP(跨机架)则最大化吞吐量。
  • 注意力数据并行(ADP): 复制注意力层以提升吞吐量,代价是单请求速度下降。

量化

  • 优势: 以更低精度格式(如 MXFP4、NVFP4)运行权重、激活值和 KV 缓存,可同时降低延迟和 token 成本。
  • 权衡: 质量可能下降,但前沿曲线通常是锯齿状的——在模型性能损失可忽略的情况下,仍可获得显著的效率提升。

"量化和推测解码为我们较小的模型带来了巨大节省。仍在追寻理想的成本/性能比。" – copperwire(HN 评论)


推动前沿的技术:整体曲线的外移

内核与运行时优化

  • 优化 CUDA 内核(如矩阵乘法)和端到端推理引擎,可减少每个 token 所需的计算量,从而在整个栈中产生累积效应。
  • Baseten 内部的 Brian Li 提供了更深入的技术细节。

推测解码

  • 概念: 使用快速草稿模型生成候选 token,然后用完整模型进行验证。
  • 演进: 早期版本存在高开销和低接受率的问题;现代方法如 EAGLE‑3DSparkDFlash 在可预测的代码生成工作负载上实现了高接受率,同时带来延迟降低和吞吐量提升。

"2026 年是推测解码成熟的一年,所有主流开源引擎都已采用,我相信它也已成为许多推理服务提供商的默认配置。" – ggcr(HN 评论)

解耦(预填充/解码分离)

  • 方法: 在专用的工作池中分别运行预填充(提示处理)和解码(token 生成)。
  • 结果: 使每个工作池都能针对其阶段进行调优——预填充是计算密集型,解码是内存密集型——从而在不牺牲延迟的前提下实现更高吞吐量。

社区对前沿概念的看法

  • 帕累托术语: 多位评论者指出,“高效前沿”本质上就是帕累托前沿,其中每个点在延迟、吞吐量和有时质量方面都是帕累托最优的。

    "本文描述的通常被称为帕累托前沿……质量/智能是第三个维度……前沿是锯齿状的,因此质量和智能需要定制化基准测试。" – datadrivenangel

  • 理念的稳定性: 核心技术(批处理、并行、量化、推测解码)已存在多年;近期的提升主要源于更好的实现,而非全新概念。

    "这些技术实际上多年来没有改变……最具影响力的改进发生在架构设计阶段。" – brrrrrm

  • 硬件限制: 在消费级 GPU(如 RTX 3090/4090)上的实践者仍难以高效运行大模型,凸显了解耦和高效内核在非数据中心环境中的重要性。

    "我的 RTX 3090 仍在嘲笑我尝试高效运行 70B 模型的努力。" – bit_rot73

  • 推测解码的渊源: 这一想法类似于 CPU 和分布式系统中的经典推测执行,展示了旧概念如何在新场景中重现。

    "推测执行在 90 年代变得流行……一切旧的都是新的。" – jumploops


推理工程师的实用建议

  1. 从权衡控制开始 – 通过实验批处理大小、TP/EP/ADP 和量化,为你的工作负载定位当前前沿上的可行点。
  2. 投资于前沿突破 – 采用内核级优化、推测解码框架以及预填充/解码解耦,以整体移动曲线。
  3. 显式测量质量 – 在量化或使用推测解码时,基准测试模型准确性(如 KL 散度、代码生成正确性),以确保你仍处于真正的帕累托前沿上。
  4. 适配硬件 – 在消费级 GPU 上,优先考虑解耦和自定义内核;在大型集群上,利用高带宽 NVLink 和宽 EP。
  5. 实证迭代 – 前沿是锯齿状的;微小的配置变化可能导致性能大幅跃升,因此系统性扫描至关重要。

进一步阅读

Sources

相关

  • Dispatch
  • 项目
  • Dispatch
  • Dispatch
  • 项目