Kimi Linear 以減少 75% 記憶體佔用與 6 倍解碼速度超越全注意力機制

Kimi Linear 以減少 75% 記憶體佔用與 6 倍解碼速度超越全注意力機制

Kimi Linear 在降低記憶體與延遲的同時超越了全注意力機制

Kimi Linear 的混合線性注意力架構在短文本、長文本以及強化學習擴展規模方面,表現均優於傳統的全注意力模型,同時將 KV-cache 減少高達 75%,並在 1 M-token 序列上實現高達 6 倍的解碼加速。


Kimi Linear 引入了什麼

Kimi Linear 在層級結構中將新型的 Kimi Delta Attention (KDA) 模組與 Multi-Head Latent Attention (MLA) 相結合。KDA 透過增加一種更細粒度的門控機制,擴展了早期的 Gated DeltaNet 設計,能更有效地利用線性注意力公式中所使用的有限狀態 RNN 記憶體。作者還設計了一種分塊演算法 (chunkwise algorithm),利用一種特殊的對角線加低階矩陣 (Diagonal-Plus-Low-Rank, DPLR) 轉換矩陣,與通用的 DPLR 方法相比減少了運算量,同時仍忠於經典的 delta rule。

「我們量身定制的分塊演算法透過對角線加低階矩陣 (DPLR) 轉換矩陣的特殊變體實現了高硬體效率,這與通用的 DPLR 公式相比大幅減少了計算量,同時與經典的 delta rule 保持更高的一致性。」 – Kimi Linear paper

實證結果:線性注意力勝過全注意力

作者使用與基準全注意力 MLA 模型相同的訓練方案,預訓練了一個 3 B-activated-parameter, 48 B-total-parameter 的 Kimi Linear 模型。在每一個評估基準——短文本語言建模、長文本檢索以及 RL 風格的擴展規模——Kimi Linear 模型大幅超越了對應的全注意力模型

關鍵性能數據:

  • KV-cache 減少: 記憶體佔用比全注意力減少高達 75%
  • 解碼吞吐量: 在 1 M-token 上下文中,速度提升高達 6 倍
  • 準確度 / 獎勵增益: 在所有任務上都有持續的改進,證實了效率的提升並非以犧牲模型品質為代價。

這些結果證明 Kimi Linear 可以作為標準注意力層的直接替代方案 (drop-in replacement),在不犧牲性能的情況下提供速度與記憶體方面的優勢。

Hacker News 上的社群反應

HN 的討論強調了幾個主題:

  • 對主張的驗證: 用戶稱讚這篇論文是「又一力作」,並指出它與較新的 Kimi K3 模型有關,後者基於 Kimi Linear 的想法並增加了視覺與 RL 的增強功能。

    「舊但相關:如果你閱讀最近發布的 Kimi K3 論文,你會發現它很大程度上基於這裡討論的 Kimi Linear,並將其規模擴大並增加了許多其他功能(如原生視覺和 RL 改進)。」 – senko

  • 開源影響: KDA 核心與 vLLM 整合的發布受到歡迎,被認為是進一步研究的強大推動力。

    「為了支持進一步研究,我們開源了 KDA 核心與 vLLM 實現,並發布了預訓練與指令微調的模型權重。這太棒了。」 – oakpond

  • 對長文本魯棒性的懷疑: 一些評論者詢問,在線性方法歷來表現不佳的經典長文本檢索任務中,這種線性注意力混合模型是否能站得住腳。

    「有人知道這在長文本檢索(大海撈針、ruler)與同等規模的全注意力模型相比表現如何嗎?效率增益看起來很棒,但這通常是線性注意力混合模型崩潰的地方。」 – imrozim

  • 與新興智能的關係: 一個更廣泛的哲學問題被提出:單純擴展架構是否能解釋湧現能力,還是其他因素(例如蒸餾)也發揮了作用。

    「該領域的專家是否知道,我們在尖端模型中看到的這種智能,是否真的是一種『湧現』現象,只有在架構擴展時才會出現?」 – pooyamo

總體而言,社群的看法是謹慎樂觀的:實證增益令人印象深刻,但預期還需要在多樣化的長文本工作負載上進行進一步驗證。

從業者技術要點

  1. 混合層級有效: 在每一層混合使用 KDA 和 MLA 比單獨使用其中之一具有更好的表達能力。
  2. 分塊 DPLR 是提速的關鍵: 特殊的 DPLR 轉換矩陣減少了矩陣乘法開銷,使線性路徑在現代 GPU/TPU 上具有競爭力。
  3. 記憶體節省轉化為更高的 Batch Size: 由於 KV-cache 減少了 75%,從業者可以在不觸及硬體限制的情況下增加上下文長度或 Batch Size。
  4. 開源堆疊已準備好整合: 發布的 KDA 核心與 vLLM 插件允許在現有的推理流水線中立即進行實驗。

未來方向

  • 擴展至更大規模的模型: Kimi K3 論文 (arXiv 2607.24653) 已經將 Kimi Linear 擴展到萬億參數規模並增加了視覺與 RL 模組,這表明該架構具有良好的擴展性。
  • 檢索任務的基準測試: 在 needle-in-haystack 和 ruler 基準測試上的獨立評估將澄清線性混合模型是否真的能在極長上下文中與全注意力機制媲美。
  • 蒸餾 vs 架構: 後續研究應將架構的貢獻與潛在的蒸餾技巧分離,以回應 HN 討論中提出的疑慮。

總結: Kimi Linear 證明了經過精心設計的線性注意力混合模型在品質與效率兩方面都能超越全注意力機制,為部署更大上下文的模型開闢了一條實用的路徑,且不會遇到常見的記憶體瓶頸。

Sources