DeepSeek-V4-Flash 更新
DeepSeek-V4-Flash 公开 Beta 发布
DeepSeek 已推出官方 DeepSeek-V4-Flash API 的公开 beta 版。此次更新重点在于显著增强代理能力,基准测试结果超过了之前的 V4-Pro-Preview。要使用更新后的模型,开发者只需在 API 调用中将模型名称设置为 deepseek-v4-flash。
性能和基准测试结果
DeepSeek-V4-Flash 在代理和编码任务上表现出显著提升。报告的基准得分如下:
- Terminal Bench 2.1: 82.7
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench (Public): 25.1
- DSBench-FullStack (Internal): 68.7
- DSBench-Hard (Internal): 59.6
对于 Code Agent 任务,模型使用 DeepSeek Harness 最小模式、最大努力级别、topp=0.95 和 temperature=1.0 进行了测试。
技术规格和集成
DeepSeek-V4-Flash-0731 保持与 DeepSeek-V4-Flash-Preview 相同的模型架构和大小;性能提升是重新后训练的结果。
关键集成细节包括:
- Responses API: 原生支持 Responses API 格式。
- Codex Adaptation: 专门针对 Codex 集成进行了适配。
- Scope: 此更新仅适用于
deepseek-v4-flashAPI。DeepSeek-V4-Pro API 以及 APP/WEB 模型保持不变,官方 V4-Pro 版本预计不久后发布。
社区见解与实际应用
用户讨论凸显了模型高智能成本比,许多开发者将其用作编码和代理工作流的主要“工作马”。
成本效率与性能
开发者报告称,对于高容量任务,运营成本极低。一位用户指出,在 30 天内,超过 3.23 亿个 token、3,467 次 API 请求仅花费 4.55 美元。另一位用户报告通过 MCP 服务器和上下文减少工具实现复杂任务,每小时约 0.50 美元。
用例专化
社区反馈表明采用分层模型策略,其中 DeepSeek-V4-Flash 用于实现和“苦力工作”,而更昂贵的模型则保留用于高层规划和审查:
"我已经将 flash 模型用于 90% 的任务……我尽量将更改控制在 1000 行以内,并亲自驱动架构决策,几乎感觉不到与前沿模型的任何差别。"
本地部署与硬件
由于其体积和效率,Flash 模型相比更大的前沿模型更易于本地托管。用户指出,它可以在消费级硬件上运行,例如双 RTX Pro 6000 GPU,提供快速且私密的云 API 替代方案。
DeepSeek API 演进时间线
DeepSeek 在 2024 和 2025 年间快速迭代其模型产品:
- July 2026: DeepSeek-V4-Flash 公开 beta 发布,增强代理能力。
- April 2026: 推出 V4-Pro 和 V4-Flash,取代遗留的
deepseek-chat和deepseek-reasoner名称。 - December 2025: 升级至 DeepSeek-V3.2,引入 distinct thinking 和 non-thinking 模式。
- August 2025: DeepSeek-V3.1 发布,具备混合推理架构和改进的工具使用(SWE-bench Verified: 66.0)。
- January 2025: 发布
deepseek-reasoner(DeepSeek-R1)。 - December 2024: 将
deepseek-chat升级至 DeepSeek-V3。 - August 2024: 实施基于磁盘的上下文缓存技术以降低 API 定价。