DeepSeekのKVキャッシュ最適化とAI推論経済の転換
DeepSeekのKVキャッシュ最適化によりメモリフットプリントを437倍削減
DeepSeekは、長文脈モデルの提供に必要なVRAMを劇的に削減するKV(Key-Value)キャッシュ最適化の一連のブレークスルーを発表しました。最新のDeepSeek-V4.1-Flashでは、グローバルKVキャッシュをトークンあたり890バイトまで削減しており、DeepSeek-V1と比較してメモリフットプリントを約437倍削減しました。
この効率化は、段階的なアーキテクチャの進化によって達成されました。
- MLA (Multi-head Latent Attention): キャッシュを約15倍圧縮した最初のブレークスルー。
- Compressed Sparse Attention (CSA) および Heavily Compressed Attention: フットプリントをさらに削減したその後の最適化。
- CSA2、クロスレイヤーキャッシュ再利用、FP4キャッシング: V4.1-Flashにおける最新の追加機能。因果エンコーダー・デコーダーアーキテクチャと組み合わせることで、メモリ要件を現在のトークンあたり890バイトまで引き下げました。
コーディングなどの長文脈ユースケースにおいて、VRAM容量は推論コストの主要な要因の一つであるため、これらの最適化は極めて重要です。
西側AIモデルの価格設定への影響
西側のAI研究所が、推論マージンを改善し消費者向け価格を引き下げるために、中国主導のこれらの最適化を採用しているという強力な証拠があります。これは、最近のモデルリリースにおけるキャッシュ読み取り操作の価格急落に反映されています。
- Anthropic Opus 5.5: Opus 5と比較してキャッシュ読み取り価格を**60%**削減。
- OpenAI GPT-6.1 Sol: GPT-5.6 Sol(7月下旬の価格)と比較してキャッシュ読み取り価格を**80%**削減。
これらの価格変動は、OpenAIとAnthropicが、おそらく中国の研究所が共有したKVキャッシュ最適化を実装することで、長文脈ウィンドウの提供コストを大幅に引き下げたことを示唆しています。ソース資料の著者は、Claude Opus 5.5やGPT-6.1 Solの静かで控えめなリリースは、これらの外部のブレークスルーへの依存に対する当惑を示している可能性があると指摘しています。
AI「競争」の戦略的分析
GPU制約の役割
高度なGPUに対する米国の輸出規制は、意図せずして中国の研究所が推論効率を優先する動機付けになったと考えられています。西側の研究所のようなハードウェアの豊富さがなかったため、中国の研究者は限られたハードウェアでパフォーマンスを最大化するためのアーキテクチャの最適化に注力し、その結果、現在世界中で採用されているブレークスルーが生まれました。
戦略としてのコモディティ化
業界の観測筋は、中国の研究所によるこれらの手法のオープンな共有は、大規模言語モデル(LLM)をコモディティ化するための戦略的な動きであると示唆しています。高効率な推論を利用可能にすることで、彼らは以下のことを試みている可能性があります。
- 独自研究所の堀を侵食する: 参入と流通のコストを下げることで、米国の一つの研究所が効率的な推論の独占を維持することを防ぐ。
- 製造業を補完する: 中国は世界的な製造業を支配しているため、製造業を補完するソフトウェア(LLM)をコモディティ化することは、物理経済にとって戦略的な優位性をもたらす。
- 急速な反復を強制する: 最適化を公開することで、フロンティア研究所は新しいモデルのトレーニングと開発にリソースを費やすことを余儀なくされ、それらはさらに他者によって蒸留または最適化される可能性がある。
反論と懐疑論
すべての観測筋が、西側の研究所が単にこれらの技術を「コピー」しているという意見に同意しているわけではありません。一部の主張は以下の通りです。
- 並行発見: 米国の主要な研究所は、同様の最適化を独自に発見する内部能力を持っている可能性が高い。
- 証拠の欠如: 価格の下落は最適化と相関していますが、GPT-6.1 SolやOpus 5.5が具体的にDeepSeekのMLAやCSAアーキテクチャを使用しているという直接的な技術的確認はありません。
- 研究の規範: ブレークスルーを共有することは標準的な学術・研究慣行であり、現在の「軍拡競争」という枠組みは、科学的現実よりも企業利益によって推進される物語である。
「ブースターの物語全体は『彼らの収益がどれだけ伸びているかを見ろ!1年足らずでARR 100億ドルから1000億ドルへ!』というものでした...しかし、その収益は単に推論が高価だったからに過ぎません。もし収益が1000億ドルから500億ドルに減少すれば、たとえ現在利益が出ていたとしても、OpenAIやAnthropicにとっては非常に見栄えが悪く、成長の物語を完全に破壊してしまいます。」
これは、効率化はマージンを増加させる一方で、高額な推論から得られるトップラインの収益を減らすことで、高評価のIPOに必要な「成長ストーリー」を逆説的に損なう可能性があることを示唆しています。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch