DeepSeek V4 Pro 0813 發佈:性能、定價與基準測試
DeepSeek V4 Pro 0813 是一款專為複雜推理和科學任務設計的高性能模型,為頂級前沿模型提供了一個具備成本效益的替代方案。雖然它在研究生水平的科學推理和專業代理任務方面表現出色,但社群回饋顯示,其基準測試性能與現實世界的編碼可靠性之間存在差異。
技術性能與基準測試
DeepSeek V4 Pro 0813 在高複雜度推理方面展現出強大的能力,特別是在科學和對話代理場景中。根據 Artificial Analysis 的數據,該模型達成了以下分數:
- 科學推理: 在 GPQA Diamond(研究生水平科學推理)上獲得 88.8%。
- 對話代理: 在 $\tau^2$-Bench Telecom 的雙控制場景下獲得 96.2%。
- 指令遵循: 在 IFBench 上獲得 76.5%。
- 長文本推理: 在 AA-LCR 上獲得 70.0%。
- 編碼: 在 SciCode(科學計算)上獲得 50.0%,在 Terminal-Bench Hard 上獲得 46.2%。
然而,該模型在研究級物理推理(CritPt 上為 12.9%)方面表現出顯著弱點,且非幻覺率較低(AA-Omniscience 上為 5.9%),這表明在某些知識領域中存在傾向於投機性回答的趨勢。
定價與 API 經濟學
DeepSeek V4 Pro 0813 被定位為極具競爭力的價值主張,用戶常將其描述為比 Opus 4.8 等競爭對手便宜約 20 倍,同時在性能上保持競爭力。
OpenRouter 定價
在 OpenRouter 上,該模型的加權平均成本如下:
- 輸入價格: $0.03942 / M tokens
- 輸出價格: $0.8697 / M tokens
官方 DeepSeek 定價結構
DeepSeek 正在實施尖峰/離峰定價模型,自 2026 年 8 月 16 日起生效,以優化負載和成本:
| Model | Period | Cache Hit (Input/1M) | Cache Miss (Input/1M) | Output (/1M) |
|---|---|---|---|---|
| V4-Flash | Off-peak | $0.007 | $0.22 | $0.66 |
| V4-Flash | Peak | $0.014 | $0.44 | $1.32 |
| V4-Pro | Off-peak | $0.022 | $0.66 | $1.98 |
| V4-Pro | Peak | $0.044 | $1.32 | $3.96 |
尖峰時段定義為 01:00–04:00 UTC 和 06:00–10:00 UTC。
用戶洞察與現實世界應用
社群回饋揭示了該模型的基準測試成功與其在軟體開發中的實際效用之間存在分歧。
編碼與可靠性
幾位開發者報告稱,與其他前沿模型相比,該模型在處理複雜、多文件存儲庫任務時表現吃力。一位用戶指出,雖然該模型對於簡單項目是稱職的,但在複雜的部署場景(例如使用 Caddy 的 Docker-compose)中會引入問題,而像 GPT-5.6-Terra 這樣的其他模型在這些場景中表現完美。
另一位用戶強調了 "pass@1" 性能的可靠性問題:
"Deepseek V4 Pro 0813 是我嘗試過最不可靠的模型...它在 pass@1 方面表現極差,非常容易出錯,且在大多數基準測試中表現糟糕。"
與 V4 Flash 的比較
有一種反覆出現的觀點認為,V4 Flash 0731 模型在一般開發任務中提供了更好的價值和更一致的結果。用戶將 Flash 描述為「能力的巨大飛躍」,通常足以應對原型設計和互動式架構工作,這使得對於某些工作流程來說,升級到 Pro 顯得微不足道,甚至令人失望。
特殊使用案例
儘管存在編碼方面的批評,該模型在研究和金融分析方面受到了讚譽。一位用戶報告稱,該模型在股票市場和外匯搜尋方面「與最昂貴的模型旗鼓對決」,另一位用戶則成功使用它在分佈式物理引擎模擬器中找到了顯著的增益。
運營指標
對於透過 OpenRouter 整合該模型的開發者,目前的運營基準如下:
- 吞吐量: 每秒 58 個 tokens (P50)。
- 延遲: 1.24 秒 (P50)。
- 在線率: 過去 3 天為 100%。
- 隱私備註: 一些用戶指出,目前的可用端點可能需要在隱私設置中啟用 "Allow paid endpoints that train on request data"。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch