DeepSeek-V4 發佈說明:為 AI Agents 提供高效的 1M-Token 上下文

DeepSeek-V4 發佈說明:為 AI Agents 提供高效的 1M-Token 上下文

DeepSeek 已發佈 DeepSeek-V4,這是一系列混合專家模型 (MoE),旨在解決長上下文代理工作負載的效率瓶頸。雖然通用基準測試具有競爭力,但其主要創新在於一種全新的注意力架構,大幅減少了 KV cache 記憶體佔用和推理 FLOPs,使得 1M-token 上下文在代理應用中具備計算可行性。

透過混合注意力實現高效長上下文推理

DeepSeek-V4 透過將注意力拆分為兩種交錯機制來實現 1M-token 的上下文窗口:壓縮稀疏注意力 (Compressed Sparse Attention, CSA) 和重度壓縮注意力 (Heavily Compressed Attention, HCA)。這種架構將 KV cache 的大小降低至標準分組查詢注意力 (GQA) 在 bfloat16 格式下 8 個 heads 所需大小的約 2%。

壓縮稀疏注意力 (CSA)

CSA 使用帶有學習位置偏置 (learned positional bias) 的 softmax-gated pooling,沿序列維度將 KV 條目壓縮 4 倍。為了維持性能,「閃電索引器」(lightning indexer,使用 FP4、ReLU-scored multi-head dot products) 會為每個查詢選擇前 k 個壓縮塊。滑動窗口分支則用於處理最近的未壓縮 token。

重度壓縮注意力 (HCA)

HCA 對 KV 條目採用更激進的 128x 壓縮。由於生成的壓縮序列非常短,模型可以在每個壓縮塊上使用密集注意力,而無需進行稀疏選擇。與 CSA 相同,HCA 也包含一個用於處理近期資訊的滑動窗口分支。

架構實現

在 DeepSeek-V4-Pro 模型 (61 層) 中,第 0–1 層使用 HCA,而第 2–60 層在 CSA 和 HCA 之間交替。最後的 MTP 塊僅使用滑動窗口注意力。為了進一步減少記憶體,模型對大多數 KV 條目使用 FP8 儲存,並對 CSA lightning indexer 使用 FP4。

代理專用優化與基礎設施

除了注意力機制外,DeepSeek-V4 還納入了三項特定的設計選擇,以提高 AI agents 在多步工具使用過程中的可靠性和連貫性。

跨工具調用的交錯思考

與以往在收到新用戶訊息時會清除推理軌跡的版本不同,V4 在涉及工具調用時,會在用戶訊息邊界之間保留推理內容。這使得模型能夠在長程任務中維持累積的思維鏈,儘管對於非工具對話用途,仍保持清除推理的標準行為以節省上下文。

專用工具調用 Schema

為了減少 JSON-in-string 格式中常見的解析錯誤和轉義失敗,V4 引入了:

  • 一個特殊的 |DSML| token。
  • 一種基於 XML 的工具調用格式。
  • 一套明確將字串參數 (string="true") 與結構化 JSON 參數 (string="false") 分開的參數系統。

用於 RL 訓練的 DSec Sandbox

代理行為是在 DeepSeek Elastic Compute (DSec) 中使用強化學習 (RL) 進行訓練的,這是一個基於 Rust 的平台。DSec 透過單一 Python SDK 支援函數調用、容器、微型虛擬機 (Firecracker) 和全功能虛擬機 (QEMU)。關鍵特性包括用於快速圖像加載和預先佔用安全軌跡回放的分層 3FS 儲存,確保 RL 展開不會因容器啟動或中斷的訓練步驟而延遲。

性能與基準測試

DeepSeek-V4-Pro-Max 在以代理為中心的基準測試中展現出與頂尖閉源模型相當的性能:

  • SWE Verified: 80.6 已解決 (與 Opus-4.6-Max 的 80.8 和 Gemini-3.1-Pro 的 80.6 相當)。
  • MCPAtlas Public: 73.6 (僅次於 Opus-4.6-Max 的 73.8)。
  • Toolathlon: 51.8 (優於 Gemini-3.1-Pro 的 48.8 和 K2.6 的 50.0)。
  • Terminal Bench 2.0: 67.9 (領先於 GLM-5.1 和 K2.6,但落後於 GPT-5.4-xHigh)。

在涉及 PyTorch、CUDA、Rust 和 C++ 的內部研發編碼基準測試中,V4-Pro-Max 達到了 67% 的通過率。長上下文檢索 (MRCR 8-needle) 在 256K tokens 時仍保持在 0.82 以上,並在 1M tokens 時保持在 0.59。

模型可用性與使用

DeepSeek 已在 Hugging Face Hub 上發佈了四個檢查點:

模型 總參數 活躍參數 類型
DeepSeek-V4-Pro 1.6T 49B Instruct
DeepSeek-V4-Flash 284B 13B Instruct
DeepSeek-V4-Pro-Base 1.6T 49B Base
DeepSeek-V4-Flash-Base 284B 13B Base

Instruct 模型支援三種推理模式:Non-think (快速)、Think High (在 <think> 塊中進行顯式推理) 以及 Think Max (最大化努力,需要至少 384K 的上下文窗口)。建議的採樣參數為 temperature=1.0top_p=1.0

Sources