推理前沿:10× 更快的模型到自我优化 AI — Baseten 演讲摘要
处理 200 K‑Token 提示
当一个 200 000‑token 请求到达时,系统首先检查提示(或其一部分)是否之前出现过,以便重用缓存的 KV 缓存;如果没有,则将请求路由到一个预填充工作器,该工作器创建 KV 缓存并返回第一个 token,然后将缓存传递给另一组 GPU 进行解码。
缓存感知路由和分离的预填充/解码
缓存感知路由选择一个具有可用预填充工作器且理想情况下有一些缓存输入的实例,以便在至少部分 token 上可以跳过预填充。将预填充和解码分离意味着一组 GPU 仅处理输入并构建 KV 缓存,而另一组 GPU 运行解码以迭代生成 token。
投机解码
一个小型投机模型运行几次超激进的前向传递来预测若干 token;主模型随后在一次前向传递中验证这些预测。被接受的投机 token 会被流式传输给用户,从而降低解码延迟。投机模型是特定于流量的;对于编码工作负载,它能够实现较高的草稿 token 接受率。
量化与误差抵消
量化虽然会带来损失,但能提升速度。主要的损失优化是量化;为了保持保真度,需要选择哪些层进行量化并进行校准以控制异常值。量化误差可以相互抵消:对某些层进行量化可能产生的误差能够抵消其他层的误差,从而得到比量化更少层时保真度更好的模型。这使得在 NVFP4 下相比其他量化版本,在保持或提升质量的同时可实现 20% 更高的吞吐量。
实现最高 10× 更快的推理
从未优化的万亿参数模型基准大约每秒 30–40 token 开始,叠加技术如量化(每步约 30‑40% 的提升)、2× 投机模型、分离的预填充/解码(约 2×)以及更好的内核/运行时,可以达到 8× 或更高的加速。在足够的流量和硬件条件下,相比 naive 部署可以实现 20%、100% 或甚至 200% 的提升,端到端的加速最高可达 10×。
NVIDIA Dynamo 与 KV‑感知路由
Dynamo 是 NVIDIA 的一个开源库,用于在集群中移动 KV 缓存;它是开发者工具包,而非开箱即用的优化器。KV‑感知路由利用 Dynamo 将 KV 缓存放置在需要的位置,支持分离并减少因节点间缓存传输导致的延迟。
模型并行、自动调优和 Mega 内核
张量并行通过高带宽互连将模型分片到多个 GPU 上;专家并行将完整的专家放置在每个 GPU 上并配备复制的路由器,以减少 GPU 间通信。当模型超过单节点内存时,才会使用流水线并行,迫使多节点分割。自动调优会遍历线程数、共享内存和并行配置,以实证方式寻找最佳延迟/吞吐量权衡。Mega 内核(融合许多操作)编写困难,且往往比模块化内核慢,因为启动开销和优化损失往往超过其带来的好处。
硬件趋势:Rubin、GPU 与 ASIC
未来的 GPU 如 Rubin 将强调更快的 CPU‑GPU 和 GPU‑GPU 互连,使得 KV 缓存卸载和系统级优化变得更加重要。虽然 GPU 正在获得类似 ASIC 的张量核心和专用指令,但它们仍然是可编程的;将模型权重完全烧录到硅中将阻止微调、量化和新检查点,因此一种专业化的光谱比纯粹的 ASIC 转变更为现实。
视频生成挑战
生成连贯的长格式视频面临二次注意力瓶颈:在 16 fps 和 480p 下,即使只有五秒的视频也涉及约 35 000 token,导致更长片段上的注意力开销达到数百万 token。对如此长序列的全注意力在计算上不可行,这推动研究朝着稀疏/时空注意力或自回归视频模型发展。当前的开源自回归视频模型存在质量漂移问题,而扩散模型在规模上仍不及闭源替代方案如 Veo 或 Kling。
持续学习与自我优化模型
持续学习可以通过更新模型权重或通过 KV‑cache 压缩来实现;后者在不改变权重的情况下保留知识,从而实现推理时的学习。GLM‑5.2 演示了自我优化:它被用于分析自身的推理,识别瓶颈内核,编写新内核,并重复该循环,Baseten 推理引擎中的一些 GPU 内核正是由 GLM‑5.2 本身编写的。这表明了一种循环:模型帮助优化运行它们的基础设施。
结束语
推理工程正从仅仅让模型快速运行转变为一个系统问题,涵盖内核、硬件互连、模型设计和持续学习。随着模型规模的增长和硬件的进步,挤出另一个 10×、100× 或甚至 1000× 的推理性能竞赛将继续进行,这由更快的网络、更好的 KV‑cache 管理以及能够改进自身服务栈的模型所驱动。