DeepSeek KV Cache 优化与 AI 推理经济学的转变

DeepSeek KV Cache 优化将内存占用降低了 437 倍

DeepSeek 推出了一系列 KV (Key-Value) Cache 优化突破,大幅降低了服务长上下文模型所需的显存 (VRAM)。最新迭代版本 DeepSeek-V4.1-Flash 已将全局 KV Cache 降低至 每 token 890 字节,与 DeepSeek-V1 相比,内存占用减少了约 437 倍。

这一效率提升是通过分阶段的架构演进实现的:

  • MLA (Multi-head Latent Attention): 最初的突破,将缓存压缩了约 15 倍。
  • 压缩稀疏注意力 (CSA) 和重度压缩注意力: 后续的优化进一步降低了内存占用。
  • CSA2、跨层缓存重用和 FP4 缓存: V4.1-Flash 中的最新功能,结合因果编码器-解码器架构,将内存需求降至目前的每 token 890 字节。

对于编程等长上下文应用场景,这些优化至关重要,因为显存容量是推理的主要成本驱动因素之一。

对西方 AI 模型定价的影响

有强有力的证据表明,西方 AI 实验室正在采用这些由中国主导的优化技术,以提高其推理利润率并降低消费者定价。这反映在近期模型版本中缓存读取操作价格的急剧下降:

  • Anthropic Opus 5.5: 缓存读取价格较 Opus 5 降低了 60%。
  • OpenAI GPT-6.1 Sol: 缓存读取价格较 GPT-5.6 Sol(7 月下旬定价)降低了 80%。

这些定价变动表明,OpenAI 和 Anthropic 已大幅降低了服务长上下文窗口的成本,很可能是通过实施中国实验室共享的 KV Cache 优化方案实现的。原始资料作者指出,Claude Opus 5.5 和 GPT-6.1 Sol 的低调发布可能暗示了对依赖这些外部突破的尴尬。

AI“竞赛”的战略分析

GPU 限制的作用

人们认为,美国对先进 GPU 的出口管制在无意中激励了中国实验室优先考虑推理效率。由于缺乏与西方实验室相同的硬件资源,中国研究人员专注于架构优化,以在有限的硬件上实现性能最大化,从而产生了目前在全球范围内被采用的突破性成果。

作为战略的商品化

行业观察人士认为,中国实验室公开分享这些方案是一种将大语言模型 (LLM) 商品化的战略举措。通过降低高效推理的门槛,他们可能试图:

  1. 削弱专有实验室的护城河: 通过降低准入和分发成本,防止任何单一的美国实验室垄断高效推理技术。
  2. 补充制造业: 由于中国在全球制造业中占据主导地位,将补充制造业的软件 (LLM) 商品化,为实体经济创造了战略优势。
  3. 强制快速迭代: 通过发布优化方案,他们迫使前沿实验室投入资源进行新模型的训练和开发,而这些模型随后可以被其他人进一步蒸馏或优化。

反面观点与质疑

并非所有观察人士都认为西方实验室只是在“抄袭”这些技术。一些人认为:

  • 平行发现: 领先的美国实验室很可能具备独立发现类似优化的内部能力。
  • 缺乏证据: 虽然价格下降与这些优化相关,但没有直接的技术确认表明 GPT-6.1 Sol 或 Opus 5.5 具体使用了 DeepSeek 的 MLA 或 CSA 架构。
  • 研究规范: 分享突破是标准的学术和研究实践,当前的“军备竞赛”框架是由企业利益而非科学现实驱动的叙事。

“整个助推叙事一直是‘看看他们的收入增长有多快!不到一年就从 100 亿美元增长到 1000 亿美元 ARR!’……但这种收入仅仅是因为推理成本昂贵。如果收入从 1000 亿美元降至 500 亿美元,这对 OpenAI 和 Anthropic 来说是非常糟糕的观感,即使他们现在已经盈利,这也彻底摧毁了增长叙事。” — @handle

这表明,虽然效率提升增加了利润率,但它可能会产生悖论,通过减少昂贵推理带来的总收入,从而损害高估值 IPO 所需的“增长故事”。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch