DeepSeek-V4-Flash 更新
DeepSeek-V4-Flash 公開測試版發布
DeepSeek 已推出官方 DeepSeek-V4-Flash API 的公開測試版。此更新專注於顯著增強代理能力,基準測試結果超越先前的 V4-Pro-Preview。要使用更新後的模型,開發者只需在 API 呼叫中將模型名稱設定為 deepseek-v4-flash。
性能與基準測試結果
DeepSeek-V4-Flash 在代理和編碼任務上展示了顯著改進。報告的基準分數如下:
- Terminal Bench 2.1: 82.7
- NL2Repo: 54.2
- Cybergym: 76.7
- DeepSWE: 54.4
- Toolathlon verified: 70.3
- Agent Last Exam: 25.2
- Automation Bench (Public): 25.1
- DSBench-FullStack (Internal): 68.7
- DSBench-Hard (Internal): 59.6
對於 Code Agent 任務,模型使用 DeepSeek Harness 最小模式、最大努力級別、topp=0.95 和 temperature=1.0 進行測試。
技術規格與整合
DeepSeek-V4-Flash-0731 保持與 DeepSeek-V4-Flash-Preview 相同的模型架構和大小;性能提升是重新後訓練的結果。
主要整合細節包括:
- Responses API: 原生支援 Responses API 格式。
- Codex 適配: 專門為 Codex 整合進行適配。
- 範圍: 此更新僅適用於
deepseek-v4-flashAPI。DeepSeek-V4-Pro API 與 APP/WEB 模型保持不變,預計不久將發布官方 V4-Pro 版本。
社群見解與實際應用
使用者討論凸顯該模型高智慧與成本比,許多開發者將其作為編碼和代理工作流程的主要「工作馬」。
成本效益與性能
開發者報告在高負載任務下運營成本極低。一位使用者指出,在 30 天內,超過 3.23 億個 token、3,467 次 API 請求僅花費 4.55 美元。另一位使用者報告透過 MCP 伺服器和情境減少工具實現複雜任務,每小時約需 0.50 美元。
使用案例專業化
社群回饋建議採用分層模型策略:DeepSeek-V4-Flash 用於實作和「基礎工作」,而較昂貴的模型則保留用於高層規劃與審閱:
"我已將 flash 模型用於 90% 的任務... 我嘗試將變更控制在 1000 行以內,並自行駕駛架構決策,與前沿模型相比幾乎沒有差異。"
本地部署與硬體
由於其體積小且效率高,Flash 模型被視為比較大型前沿模型更適合本地託管。使用者指出,它可以在消費者級硬體上運行,例如雙 RTX Pro 6000 GPU,提供快速且私密的雲端 API 替代方案。
DeepSeek API 演變時間線
DeepSeek 在 2024 年和 2025 年間快速迭代其模型供應:
- 2026 年 7 月: DeepSeek-V4-Flash 公開測試版發布,增強代理能力。
- 2026 年 4 月: 推出 V4-Pro 和 V4-Flash,取代舊版
deepseek-chat和deepseek-reasoner名稱。 - 2025 年 12 月: 升級至 DeepSeek-V3.2,引入獨立的思考與非思考模式。
- 2025 年 8 月: DeepSeek-V3.1 發布,具備混合推理架構和改進的工具使用(SWE-bench Verified:66.0)。
- 2025 年 1 月: 推出
deepseek-reasoner(DeepSeek-R1)。 - 2024 年 12 月: 將
deepseek-chat升級至 DeepSeek-V3。 - 2024 年 8 月: 實作磁盤上下文快取技術以降低 API 定價。