Kimi Linear 在 75% 更少内存和 6× 更快解码的情况下优于全注意力
Kimi Linear 在 75% 更少内存和 6× 更快解码的情况下优于全注意力
Kimi Linear 在减少内存和延迟的同时击败全注意力
Kimi Linear 的混合线性注意力架构在短上下文、长上下文和强化学习扩展场景中优于传统的全注意力模型,同时使用最多 75% 更少的 KV‑cache,并为 1 M‑token 序列提供最高 6× 更快的解码。
什么是 Kimi Linear 引入的
Kimi Linear 将一种新颖的 Kimi Delta Attention (KDA) 模块与多头潜在注意力(MLA)在逐层混合中结合。KDA 通过添加一个 更精细的门控机制 扩展了早期的 Gated DeltaNet 设计,从而更有效地利用线性注意力公式中使用的有限状态 RNN 内存。作者还设计了一种 分块算法,该算法利用一种特殊的对角线加低秩(DPLR)转移矩阵,相比通用 DPLR 方法减少了运算量,同时忠实于经典的 delta 法则。
"我们专门的分块算法通过专门的对角线加低秩(DPLR)转移矩阵变体实现高硬件效率,相比通用 DPLR 公式显著减少了计算量,同时更符合经典的 delta 法则。– Kimi Linear paper。
实证结果:线性注意力击败全注意力
作者使用与基线全注意力 MLA 模型相同的训练配方预训练了一个 3 B‑activated‑parameter, 48 B‑total‑parameter 的 Kimi Linear 模型。在所有评估的基准测试中——短上下文语言建模、长上下文检索和 RL 风格的扩展——Kimi Linear 模型 以显著的优势超越了全注意力对应模型。
关键性能数字:
- KV‑cache 减少: 比全注意力少多达 75 % 的内存。
- 解码吞吐量: 在 1 M‑token 上下文中最多快 6×。
- 准确率 / 收益提升: 在所有任务上持续改进,证实效率提升并未以牺牲模型质量为代价。
这些结果表明,Kimi Linear 可以作为标准注意力层的 直接替代方案,在不牺牲性能的情况下提供速度和内存双重好处。
在 Hacker News 上的社区反应
HN 讨论凸显了几个主题:
- 声明验证: 用户称赞该论文是“另一颗炸弹”,并指出其与较新的 Kimi K3 模型的相关性,该模型建立在 Kimi Linear 的思想之上,并添加了视觉和 RL 增强。
"虽然旧但仍然相关:如果你阅读最近发布的 Kimi K3 论文,你会发现它在很大程度上基于这里讨论的 Kimi Linear,进行了扩展并添加了许多其他内容(如原生视觉和 RL 改进)。" – senko。
- 开源影响: KDA 内核和 vLLM 集成的发布被视为推进进一步研究的强大推动器。
"为了支持进一步的研究,我们开源了 KDA 内核和 vLLM 实现,并发布了预训练和指令调优的模型检查点。这真是太棒了。* – oakpond。
- 对长上下文鲁棒性的怀疑: 一些评论者质疑线性注意力混合在经典长上下文检索任务中的表现,而线性方法在这些任务上历史上表现不佳。
"有人知道这在长上下文检索(大海捞针、尺子)方面与同样大小的全注意力模型相比表现如何?虽然效率提升看起来很好,但通常这就是线性注意力混合失效的地方。* – imrozim。
- 与新兴智能的关系: 提出了一个更广泛的哲学问题,即仅通过架构缩放是否能解释涌现能力,或者其他因素(例如蒸馏)是否也起作用。
"该领域的任何专家都知道,我们在前沿模型中看到的这种智能究竟是不是一种‘涌现’现象,只有在架构被缩放时才会出现吗?* – pooyamo。
总体而言,社区持谨慎乐观的态度:实证收益令人印象深刻,但人们期望在各种长上下文工作负载上进行进一步验证。
从业者的技术要点
- 混合层次有效: 在每层基础上混合 KDA 和 MLA 相比单独使用任一方能提供更好的表达能力。
- 分块 DPLR 是速度的关键: 专用的 DPLR 转移矩阵减少了矩阵乘法开销,使得线性路径在现代 GPU/TPU 上具有竞争力。
- 内存节省转化为更大的批量: 由于 KV cache 减少了 75%,从业者可以在不达到硬件限制的情况下增加上下文长度或批量大小。
- 开源栈已准备好集成: 发布的 KDA 内核和 vLLM 插件允许在现有推理管道中立即进行实验。
未来方向
- 扩展到更大模型: Kimi K3 论文(arXiv 2607.24653)已经将 Kimi Linear 扩展到万亿参数规模,并添加了视觉和 RL 模块,表明该架构具有良好的扩展性。 *。
- 在检索任务上的基准测试: 在 needle‑in‑haystack 和 ruler 基准上的独立评估将澄清线性混合是否真的在极长上下文中匹配全注意力。
- 蒸馏 vs 架构: 后续研究应隔离架构的贡献与潜在蒸馏技巧,以解决在 HN 讨论中提出的担忧。
结论: Kimi Linear 表明,一个精心设计的线性注意力混合可以在质量和效率上 超越 全注意力,为在不遇到通常内存瓶颈的情况下部署更大上下文模型提供了一条实际道路。