标题: Kimi K3 架构概览
Kimi K3 架构概览
Kimi K3 是一个拥有 2.8 万亿参数的巨型开放权重模型,是在之前的 Kimi Linear 模型架构基础上进行扩展。它通过集成 LatentMoE 和多头潜在注意力来最大化推理效率,同时引入了原生多模态支持。
效率驱动的架构组件
Kimi K3 使用经过效率优化的版本替换标准模型组件,以降低其 2.8T 参数规模的计算开销。
LatentMoE
Kimi K3 实现了 LatentMoE,这是一种与 Nemotron 3 Ultra 中发现的组件类似的方法。该方法通过下投影压缩大型线性层,有效降低了混合专家(MoE)层的内存和计算需求。
多头潜在注意力和 Kimi Delta Attention
为了进一步优化推理,模型用多头潜在注意力和 Kimi Delta Attention 替换了常规注意力机制。这些组件旨在提高大规模下注意力机制的吞吐量和效率。
性能和结构增强
除了效率之外,Kimi K3 引入了特定的结构变化,以提升模型的学习能力和验证损失。
注意力残差
Kimi K3 使用注意力残差来改善残差路径。与 DeepSeek V4 中使用的流形约束超连接(mHC)不同——后者会扩大残差路径——注意力残差通过注意力分数在层间连接残差,以确定贡献的权重。这一修改能够持续改善验证损失和下游性能,使训练成本增加约 4%,推理成本增加约 2%。
NoPE(无位置嵌入)
与业界在局部注意力层使用旋转位置嵌入(RoPE)的趋势不同,Kimi K3 在所有地方使用 NoPE(无位置嵌入)。这一设计继承自 Kimi Linear,使 Kimi K3 成为首个完全省略位置嵌入、而是通过隐式学习位置信息的前沿级模型。
社区见解与观察
围绕 K3 发布的技术讨论凸显了其创新程度以及对省略位置嵌入的怀疑。
"有趣的是,Kimi K3 去掉了所有 RoPE 层,改为到处使用 NoPE(无位置嵌入)……这甚至能工作让我感到困惑。难道它只是变成了 token 汤吗?"
一些观察者认为,诸如 Kimi Delta 之类的线性注意力机制可能在隐式处理位置需求,使得模型能够在没有显式 RoPE 层的情况下运行。此外,用户还指出,Kimi K3 的性能与其他前沿模型(如 Opus 4.7/4.8)具有高度竞争力。