DeepSeek-V4 发布说明:为 AI Agent 提供高效的 1M-Token 上下文

DeepSeek-V4 发布说明:为 AI Agent 提供高效的 1M-Token 上下文

DeepSeek 发布了 DeepSeek-V4,这是一系列混合专家(MoE)模型,旨在解决长上下文智能体(agentic)工作负载的效率瓶颈。虽然通用基准测试具有竞争力,但其核心创新在于一种全新的注意力架构,该架构大幅降低了 KV cache 内存占用和推理 FLOPs,使得 1M-token 上下文在智能体应用中具有计算可行性。

通过混合注意力实现高效长上下文推理

DeepSeek-V4 通过将注意力机制拆分为两种交替机制来实现 1M-token 上下文窗口:压缩稀疏注意力(Compressed Sparse Attention, CSA)和重度压缩注意力(Heavily Compressed Attention, HCA)。该架构将 KV cache 的大小降低到标准分组查询注意力(GQA)在 bfloat16 精度下 8 heads 配置下所需大小的约 2%。

压缩稀疏注意力 (CSA)

CSA 使用带有学习位置偏置的 softmax-gated pooling,沿序列维度将 KV 条目压缩 4 倍。为了保持性能,“lightning indexer”(使用 FP4、ReLU-scored multi-head dot products)会为每个 query 选择前 k 个压缩块。同时使用滑动窗口分支来处理最近的未压缩 token。

重度压缩注意力 (HCA)

HCA 对 KV 条目采用更激进的 128x 压缩。由于生成的压缩序列非常短,模型可以在每个压缩块上使用密集注意力,而无需进行稀疏选择。与 CSA 一样,HCA 也包含一个用于处理近期信息的滑动窗口分支。

架构实现

在 DeepSeek-V4-Pro 模型(61 层)中,第 0–1 层使用 HCA,而第 2–60 层在 CSA 和 HCA 之间交替。最后的 MTP 块仅使用滑动窗口注意力。为了进一步减少内存,模型对大多数 KV 条目使用 FP8 存储,对 CSA lightning indexer 使用 FP4。

针对 Agent 的优化与基础设施

除了注意力机制外,DeepSeek-V4 还结合了三项特定的设计选择,以提高 AI Agent 在多步工具使用过程中的可靠性和连贯性。

跨工具调用的交替思考

与之前版本在收到新用户消息时会清除推理轨迹不同,V4 在涉及工具调用时会跨用户消息边界保留推理内容。这使得模型能够在长程任务中保持累积的思维链,尽管对于非工具对话使用,仍保持清除推理的标准行为以节省上下文。

专用工具调用 Schema

为了减少 JSON-in-string 格式中常见的解析错误和转义失败,V4 引入了:

  • 一个特殊的 |DSML| token。
  • 基于 XML 的工具调用格式。
  • 一个显式将字符串参数 (string="true") 与结构化 JSON 参数 (string="false") 分开的参数系统。

用于 RL 训练的 DSec Sandbox

Agent 行为是在 DeepSeek Elastic Compute (DSec) 中使用强化学习 (RL) 进行训练的,这是一个基于 Rust 的平台。DSec 通过单个 Python SDK 支持函数调用、容器、微型虚拟机 (Firecracker) 和全功能虚拟机 (QEMU)。关键特性包括用于快速图像加载和抢占安全轨迹回放的分层 3FS 存储,确保 RL rollouts 不会因容器启动或中断的训练步骤而延迟。

性能与基准测试

DeepSeek-V4-Pro-Max 在以 Agent 为中心的基准测试中表现出与顶尖闭源模型相当的水平:

  • SWE Verified: 80.6 已解决(与 Opus-4.6-Max 的 80.8 和 Gemini-3.1-Pro 的 80.6 相当)。
  • MCPAtlas Public: 73.6(仅次于 Opus-4.6-Max 的 73.8)。
  • Toolathlon: 51.8(优于 Gemini-3.1-Pro 的 48.8 和 K2.6 的 50.0)。
  • Terminal Bench 2.0: 67.9(领先于 GLM-5.1 和 K2.6,但落后于 GPT-5.4-xHigh)。

在涉及 PyTorch、CUDA、Rust 和 C++ 的内部研发编码基准测试中,V4-Pro-Max 实现了 67% 的通过率。长上下文检索(MRCR 8-needle)在 256K token 时保持在 0.82 以上,在 1M token 时保持在 0.59。

模型可用性与使用

DeepSeek 已在 Hugging Face Hub 上发布了四个检查点:

模型 总参数量 激活参数量 类型
DeepSeek-V4-Pro 1.6T 49B Instruct
DeepSeek-V4-Flash 284B 13B Instruct
DeepSeek-V4-Pro-Base 1.6T 49B Base
DeepSeek-V4-Flash-Base 284B 13B Base

Instruct 模型支持三种推理模式:Non-think(快速)、Think High(在 <think> 块中进行显式推理)以及 Think Max(最大化努力,至少需要 384K 上下文窗口)。建议的采样参数为 temperature=1.0top_p=1.0

Sources