LLM 效率的演进:KV 共享、mHC 与压缩注意力
The landscape of Large Language Model (LLM) architectures is shifting. While the fundamental decoder-only transformer remains the status quo, the focus has moved from simply scaling parameters to optimizing for long-context efficiency. As reasoning models and agentic workflows require models to maintain more tokens in memory for longer periods, the KV-cache size, memory traffic, and attention costs have become the primary bottlenecks.
Recent releases from Google, DeepSeek, and other open-weight contributors reveal a trend: the introduction of intricate "architecture tricks" designed to reduce the computational and memory footprint of long-context inference without sacrificing representational capacity.
Gemma 4:KV 共享与层级嵌入
Google 的 Gemma 4 系列在其较小的变体(E2B 和 E4B)中引入了两项重要的面向效率的设计选择。
跨层 KV 共享
为应对 KV 缓存的内存需求,Gemma 4 采用了共享 KV 缓存方案。虽然 Grouped Query Attention(GQA)已经在单层内部跨多个查询头共享 KV 头,Gemma 4 更进一步,在不同层之间共享 KV 投影。
在此设置下,后续层会复用同类注意力类型中最近的前置非共享层的键值状态。例如,在 Gemma 4 E2B 模型中,只有前 15 层(共 35 层)计算各自的 KV 投影;其余 20 层复用这些投影。此举有效将 KV 缓存大小减半,为 128K 上下文的 E2B 模型节省约 2.7 GB 内存,在 E4B 模型中节省约 6 GB。
层级嵌入 (PLE)
虽然 KV 共享降低了内存占用,PLE 则侧重于参数效率。其目标是让小模型能够利用更多 token 级别的特定信息,而无需扩展整个 transformer 堆栈。
PLE 并不是为每个块提供完整的 token 嵌入层副本,而是为每个 transformer 块提供一个小的、层特定的 token 向量。该向量由隐藏状态进行门控,并在前馈分支之后作为额外的残差更新加入。这样,模型能够在保持昂贵 transformer 块的“有效”参数量较小的同时,将额外容量存储在更廉价的查表式嵌入表中。
Laguna XS.2:层级注意力预算
Poolside 的 Laguna XS.2 引入了“层级注意力预算”的概念,挑战了每个 transformer 层都需要相同注意力容量的假设。
Laguna XS.2 通过混合使用 30 个滑动窗口注意力层(局部上下文)和 10 个全局注意力层(完整上下文),在层级上变化注意力成本。创新之处在于使用层级查询头数量。具体而言,模型为成本较低的滑动窗口层分配更多查询头,为成本较高的全局层分配更少查询头,同时保持 KV 头固定。这确保了注意力容量被投入到计算效率最高的地方。
ZAYA1-8B:压缩卷积注意力 (CCA)
ZAYA1-8B 由 Zyphra 开发,引入了压缩卷积注意力(Compressed Convolutional Attention,CCA),一种直接在压缩潜在空间中运行的机制。
不同于 Multi-head Latent Attention(MLA),后者主要利用潜在表征来缩减 KV 缓存再投射回计算,CCA 则在压缩空间内部直接执行注意力操作。这不仅降低了 KV 缓存大小,也减少了预填充和训练期间的 FLOPs。
为缓解压缩导致的表达能力损失,CCA 对压缩后的查询(Q)和键(K)表征进行卷积混合。这些卷积在计算注意力得分之前为压缩向量提供局部上下文,开发者声称这使得 CCA 在相似压缩设置下能够超越 MLA。
DeepSeek V4:mHC 与序列压缩
DeepSeek V4 代表了架构复杂性的巨大飞跃,关注点在残差路径和注意力机制两方面。
流形约束超连接 (mHC)
DeepSeek V4 通过将单一残差流替换为多个并行残差流(超连接)来现代化残差连接。为防止信号在深层中不可预测地放大或收缩,DeepSeek 引入了“流形约束”。
残差映射被投射到双随机矩阵的流形上(即矩阵元素非负且行/列和为 1)。这确保了信息在并行流之间的稳定再分配,使残差路径更具表达力,同时并未显著增加 Attention 或 MoE 层的 FLOPs。
CSA 与 HCA:序列长度压缩
虽然 MLA 压缩每个 token 的表征,DeepSeek V4 的压缩稀疏注意力(CSA)和高度压缩注意力(HCA)则压缩序列长度本身。
- CSA(Compressed Sparse Attention,压缩稀疏注意力): 使用温和的压缩率和稀疏选择器来识别最相关的压缩历史块。
- HCA(Heavily Compressed Attention,高度压缩注意力): 采用激进的压缩(例如将 128 个 token 压缩为一个条目),并在这些条目上执行密集注意力。
通过交错使用 CSA 与 HCA 层,并为近期 token 保持本地滑动窗口分支,DeepSeek V4‑Pro 实现了大幅度的开销降低。在 1M token 上下文下,其 KV 缓存大小仅为 DeepSeek V3.2 的 10%,推理 FLOPs 为 27%。
架构趋势概览
从 GPT-2 到 DeepSeek V4 的演进展示了一条清晰的轨迹:transformer 块不再是静态实体,而是由专门优化组成的模块化系统。当前趋势是提升块内部的复杂度,以降低运行时成本。
| Model | Primary Efficiency Innovation | Target Metric |
|---|---|---|
| Gemma 4 | Cross-layer KV sharing & PLE | KV Cache Memory / Parameter Efficiency |
| Laguna XS.2 | Per-layer query-head budgeting | Attention FLOPs |
| ZAYA1-8B | Compressed Convolutional Attention | KV Cache & Attention FLOPs |
| DeepSeek V4 | mHC & CSA/HCA | Residual Expressiveness / Long-Context Memory |
随着这些模型迈向代理工作流和大规模上下文窗口,能够在保持模型质量的同时精准削减内存和计算开销,将成为下一代 LLM 架构的决定性特征。