DeepSeek KV Cache 優化與 AI 推論經濟的轉變
DeepSeek KV Cache 優化將記憶體佔用減少了 437 倍
DeepSeek 推出了一系列 KV (Key-Value) cache 優化突破,大幅降低了服務長文本模型所需的 VRAM。最新版本 DeepSeek-V4.1-Flash 將全域 KV cache 減少至 每個 token 890 bytes,與 DeepSeek-V1 相比,記憶體佔用量減少了約 437 倍。
這種效率提升是透過階段性的架構演進實現的:
- MLA (Multi-head Latent Attention): 最初的突破,將快取壓縮了約 15 倍。
- 壓縮稀疏注意力 (CSA) 與重度壓縮注意力: 後續的優化進一步減少了佔用空間。
- CSA2、跨層快取重用與 FP4 快取: V4.1-Flash 中的最新功能,結合因果編碼器-解碼器架構,將記憶體需求降低至目前的每個 token 890 bytes。
對於程式設計等長文本應用場景,這些優化至關重要,因為 VRAM 容量是推論的主要成本驅動因素之一。
對西方 AI 模型定價的影響
有強有力的證據顯示,西方 AI 實驗室正在採用這些由中國主導的優化技術,以提高推論利潤率並降低消費者價格。這反映在近期模型發布中快取讀取 (cache-read) 操作的價格大幅下降:
- Anthropic Opus 5.5: 與 Opus 5 相比,快取讀取價格降低了 60%。
- OpenAI GPT-6.1 Sol: 與 GPT-5.6 Sol(7 月下旬定價)相比,快取讀取價格降低了 80%。
這些定價轉變表明,OpenAI 和 Anthropic 已大幅降低了服務長文本視窗的成本,很可能是透過實作中國實驗室分享的 KV cache 優化技術。原始資料的作者指出,Claude Opus 5.5 和 GPT-6.1 Sol 的低調發布,可能顯示出對依賴這些外部突破的尷尬感。
AI「競賽」的策略分析
GPU 限制的角色
美國對先進 GPU 的出口管制被認為無意中激勵了中國實驗室優先考慮推論效率。由於缺乏與西方實驗室相同的硬體資源,中國研究人員專注於架構優化,以在有限的硬體上最大化效能,從而產生了現在全球都在採用的突破性技術。
商品化作為策略
產業觀察家認為,中國實驗室公開分享這些技術配方是一種將大型語言模型 (LLM) 商品化的策略舉措。透過讓高效能推論變得普及,他們可能試圖:
- 侵蝕專有實驗室的護城河: 透過降低進入和分發成本,防止任何單一美國實驗室壟斷高效推論技術。
- 補充製造業: 由於中國主導全球製造業,將補充製造業的軟體 (LLM) 商品化,為實體經濟創造了策略優勢。
- 強制快速迭代: 透過釋出優化技術,迫使前沿實驗室投入資源訓練和開發新模型,而這些模型隨後可以被其他人進一步蒸餾或優化。
反面觀點與質疑
並非所有觀察家都同意西方實驗室只是在「抄襲」這些技術。有些人認為:
- 平行發現: 領先的美國實驗室很可能具備獨立發現類似優化技術的內部能力。
- 缺乏證據: 雖然價格下降與這些優化技術相關,但沒有直接的技術確認 GPT-6.1 Sol 或 Opus 5.5 特別使用了 DeepSeek 的 MLA 或 CSA 架構。
- 研究規範: 分享突破性成果是標準的學術和研究慣例,目前的「軍備競賽」框架是由企業利益驅動的敘事,而非科學現實。
「整個推動敘事一直是『看看他們的營收成長有多快!不到一年就從 100 億美元成長到 1000 億美元 ARR!』……但這些營收只是因為推論成本很高。如果營收從 1000 億美元降至 500 億美元,即使他們現在獲利了,對 OpenAI 和 Anthropic 來說也是非常糟糕的觀感,這完全摧毀了成長敘事。」
這表明,雖然效率提升增加了利潤率,但透過減少昂貴推論產生的營收,可能會與高估值 IPO 所需的「成長故事」背道而馳。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch