DeepSeek V4 Pro 0813 发布:性能、价格与基准测试

DeepSeek V4 Pro 0813 是一款专为复杂推理和科学任务设计的高性能模型,为顶级前沿模型提供了一个具有成本效益的替代方案。虽然它在研究生水平的科学推理和专门的智能体任务方面表现出色,但社区反馈表明,其基准测试性能与实际编程可靠性之间存在差异。

技术性能与基准测试

DeepSeek V4 Pro 0813 在高复杂度推理方面表现出强大的能力,特别是在科学和对话智能体场景中。根据 Artificial Analysis 的数据,该模型实现了以下评分:

  • 科学推理: GPQA Diamond (研究生水平科学推理) 得分为 88.8%。
  • 对话智能体: 在双控制场景下的 $\tau^2$-Bench Telecom 得分为 96.2%。
  • 指令遵循: IFBench 得分为 76.5%。
  • 长上下文推理: AA-LCR 得分为 70.0%。
  • 编程: SciCode (科学计算) 得分为 50.0%,Terminal-Bench Hard 得分为 46.2%。

然而,该模型在研究级物理推理 (CritPt 得分为 12.9%) 和低非幻觉率 (AA-Omniscience 得分为 5.9%) 方面表现出明显的弱点,这表明在某些知识领域存在产生投机性回答的倾向。

价格与 API 经济学

DeepSeek V4 Pro 0813 被定位为一个极具竞争力的价值主张,用户通常将其描述为比 Opus 4.8 等竞争对手便宜约 20 倍,同时在性能上保持竞争力。

OpenRouter 价格

在 OpenRouter 上,该模型具有以下加权平均成本:

  • 输入价格: $0.03942 / M tokens
  • 输出价格: $0.8697 / M tokens

官方 DeepSeek 价格结构

DeepSeek 正在实施一种高峰/非高峰定价模型,自 2026 年 8 月 16 日起生效,以优化负载和成本:

Model Period Cache Hit (Input/1M) Cache Miss (Input/1M) Output (/1M)
V4-Flash Off-peak $0.007 $0.22 $0.66
V4-Flash Peak $0.014 $0.44 $1.32
V4-Pro Off-peak $0.022 $0.66 $1.98
V4-Pro Peak $0.044 $1.32 $3.96

高峰时段定义为 01:00–04:00 UTC 和 06:00–10:00 UTC。

用户洞察与实际应用

社区反馈揭示了该模型在基准测试成功与软件开发中的实际效用之间存在分歧。

编程与可靠性

几位开发者报告称,与其他前沿模型相比,该模型在处理复杂的、多文件仓库任务时表现吃力。一位用户指出,虽然该模型对于简单项目是胜任的,但在复杂的部署场景(例如使用 Caddy 的 Docker-compose)中会引入问题,而像 GPT-5.6-Terra 这样的其他模型在这些场景中表现完美。

另一位用户强调了

Sources

相关