DeepSeek-V4-Flash 更新

DeepSeek-V4-Flash 公开 Beta 发布

DeepSeek 已推出官方 DeepSeek-V4-Flash API 的公开 beta 版。此次更新重点在于显著增强代理能力,基准测试结果超过了之前的 V4-Pro-Preview。要使用更新后的模型,开发者只需在 API 调用中将模型名称设置为 deepseek-v4-flash

性能和基准测试结果

DeepSeek-V4-Flash 在代理和编码任务上表现出显著提升。报告的基准得分如下:

  • Terminal Bench 2.1: 82.7
  • NL2Repo: 54.2
  • Cybergym: 76.7
  • DeepSWE: 54.4
  • Toolathlon verified: 70.3
  • Agent Last Exam: 25.2
  • Automation Bench (Public): 25.1
  • DSBench-FullStack (Internal): 68.7
  • DSBench-Hard (Internal): 59.6

对于 Code Agent 任务,模型使用 DeepSeek Harness 最小模式、最大努力级别、topp=0.95temperature=1.0 进行了测试。

技术规格和集成

DeepSeek-V4-Flash-0731 保持与 DeepSeek-V4-Flash-Preview 相同的模型架构和大小;性能提升是重新后训练的结果。

关键集成细节包括:

  • Responses API: 原生支持 Responses API 格式。
  • Codex Adaptation: 专门针对 Codex 集成进行了适配。
  • Scope: 此更新仅适用于 deepseek-v4-flash API。DeepSeek-V4-Pro API 以及 APP/WEB 模型保持不变,官方 V4-Pro 版本预计不久后发布。

社区见解与实际应用

用户讨论凸显了模型高智能成本比,许多开发者将其用作编码和代理工作流的主要“工作马”。

成本效率与性能

开发者报告称,对于高容量任务,运营成本极低。一位用户指出,在 30 天内,超过 3.23 亿个 token、3,467 次 API 请求仅花费 4.55 美元。另一位用户报告通过 MCP 服务器和上下文减少工具实现复杂任务,每小时约 0.50 美元。

用例专化

社区反馈表明采用分层模型策略,其中 DeepSeek-V4-Flash 用于实现和“苦力工作”,而更昂贵的模型则保留用于高层规划和审查:

"我已经将 flash 模型用于 90% 的任务……我尽量将更改控制在 1000 行以内,并亲自驱动架构决策,几乎感觉不到与前沿模型的任何差别。"

本地部署与硬件

由于其体积和效率,Flash 模型相比更大的前沿模型更易于本地托管。用户指出,它可以在消费级硬件上运行,例如双 RTX Pro 6000 GPU,提供快速且私密的云 API 替代方案。

DeepSeek API 演进时间线

DeepSeek 在 2024 和 2025 年间快速迭代其模型产品:

  • July 2026: DeepSeek-V4-Flash 公开 beta 发布,增强代理能力。
  • April 2026: 推出 V4-Pro 和 V4-Flash,取代遗留的 deepseek-chatdeepseek-reasoner 名称。
  • December 2025: 升级至 DeepSeek-V3.2,引入 distinct thinking 和 non-thinking 模式。
  • August 2025: DeepSeek-V3.1 发布,具备混合推理架构和改进的工具使用(SWE-bench Verified: 66.0)。
  • January 2025: 发布 deepseek-reasoner(DeepSeek-R1)。
  • December 2024:deepseek-chat 升级至 DeepSeek-V3。
  • August 2024: 实施基于磁盘的上下文缓存技术以降低 API 定价。

Sources