Kimi K3 架構概覽

Kimi K3 架構概覽

Kimi K3 是一個擁有 2.8 兆參數的巨型開放權重模型,擴展了先前 Kimi Linear 模型的架構。它透過整合 LatentMoE 和多頭潛在注意力來最大化推理效率,同時引入了原生多模態支援。

效率驅動的架構組件

Kimi K3 使用經過效率調整的版本來取代標準模型組件,以降低其 2.8T 參數規模的計算開銷。

LatentMoE

Kimi K3 實作了 LatentMoE,這是一個與 Nemotron 3 Ultra 中所見類似的組件。此方法透過下投影壓縮大型線性層,有效降低了混合專家(MoE)層的記憶體與運算需求。

Multi-Head Latent Attention and Kimi Delta Attention

為了進一步優化推理,該模型使用多頭潛在注意力和 Kimi Delta Attention 取代常規注意力機制。這些組件旨在提升大規模下注意力機制的吞吐量與效率。

Performance and Structural Enhancements

除了效率之外,Kimi K3 引入了特定的結構變更,以提升模型的學習能力並降低驗證損失。

Attention Residuals

Kimi K3 使用注意力殘差來改善殘差路徑。與 DeepSeek V4 中使用的流形約束 Hyper-Connections(mHC)不同——後者會擴寬殘差路徑——注意力殘差透過注意力分數來決定貢獻的權重,從而在層與層之間連接殘差。此修改能持續改善驗證損失與下游性能,訓練成本增加約 4%,推理成本增加約 2%。

NoPE (No Positional Embeddings)

與業界在局部注意力層使用旋轉位置嵌入(RoPE)的趨勢不同,Kimi K3 在所有地方都使用 NoPE(無位置嵌入)。此設計繼承自 Kimi Linear,並使 Kimi K3 成為首個完全省略位置嵌入、改為隱式學習位置資訊的前沿級模型。

Community Insights and Observations

圍繞 K3 發布的技術討論凸顯了創新程度以及對省略位置嵌入的懷疑。

"有趣的是,Kimi K3 已經移除所有 RoPE 層,並改為到處使用 NoPE(無位置嵌入)……這讓我感到困惑,這竟然還能運作。難道它只是變成了 token 湯嗎?"

一些觀察者指出,線性注意力機制(例如 Kimi Delta)可能在隱式處理位置需求,使得模型無需顯式 RoPE 層也能運作。此外,使用者指出 Kimi K3 的表現與其他前沿模型(如 Opus 4.7/4.8)具有高度競爭力。

Sources