DeepSeek V4 Flash 0731 在每项任务 $0.02 至 $0.04 的成本下,实现 ARC‑AGI‑1 89% 和 ARC‑AGI‑2 61.4% 的成绩
概述
DeepSeek V4 Flash 0731 在 ARC‑AGI 基准测试套件中表现出顶级性能——在 ARC‑AGI‑1(半私有)上达到 89.0%,在 ARC‑AGI‑2(半私有)上达到 61.4%,每项任务成本分别为 $0.02 和 $0.04。这些数据表明该模型在高分系统中名列前茅,同时推理成本比许多专有替代方案低一个数量级。
基准测试结果
官方 ARC‑AGI 排行榜报告了 DeepSeek V4 Flash 0731 的三种推理变体:
| 变体 | ARC‑AGI‑1 | ARC‑AGI‑2 | ARC‑AGI‑3 |
|---|---|---|---|
| 最大 | 89.0% | 61.4% | — |
| 高 | 87.0% | 56.0% | — |
| 低 | 84.0% | 46.0% | — |
"最大"变体使用最激进的推理设置,在两个基准测试中均优于 "高" 和 "低" 配置。截至本文撰写时,该模型尚未报告 ARC‑AGI‑3 的得分。
任务级通过/失败(ARC‑AGI‑2 公开评估)
在 120 个公开评估任务中,最大变体通过了 73 项,高变体通过了 71 项,低变体通过了 58 项。详细的通过/失败矩阵显示,该模型在涉及逻辑推理和代码推理的任务上表现出持续优势,但部分视觉谜题类任务仍具挑战性。
成本效益
DeepSeek V4 Flash 0731 在 "最大努力" 定价层级下,对 ARC‑AGI‑1 任务收费 $0.02,对 ARC‑AGI‑2 任务收费 $0.04。当使用提供方引用的缓存定价模型时,这相当于每 1 M 标记约 $0.02‑$0.04。社区成员反复强调其几乎可以忽略的运营成本:
"我在 Oh My Pi 中运行它,还开了一个第二实例作为 "顾问",即使有 5-6 个活跃会话,我每天也很难花超过 5 美元。" – @LaurensBER
"DeepSeek 是我用于 API 的便宜又愉快的中国模型首选。更便宜,现在甚至比 Pro 还好……不是最好的,但整体上比同价位任何模型都强。" – @SwellJoe
现实世界使用洞察
速度与可部署性
用户报告称,该模型在双 RTX 6000 Blackwell 系统上运行时,预填充速度约为 ~8 k 标记/秒,生成速度约为 ~250 标记/秒,通过 vLLM 使用 64 个并发流时可扩展至 ~1 k 标记/秒。这种吞吐量可实现无明显延迟的交互式聊天,并支持大规模代理部署。
"在 2x RTX Pro 6000 Blackwell 上,其预填充速度约为 ~8k 标记/秒,单流生成速度约为 ~250 标记/秒。我在 vLLM 上看到 ~64 个并发流时达到了 1000 标记/秒。这速度足够快,你可以在等待时直接与它交互聊天,无需切换标签页。" – @ak_t
编程与工具使用
该模型因其编程辅助和工具调用能力而受到赞誉,在日常开发工作流中经常优于更大的专有模型。
"我强烈建议尝试用它处理编程任务。它在编码方面表现强劲(虽然不如 Fable 那样强),但比 Opus 更好的‘人格’设定和截然不同的盲点。……总体而言,我现在更喜欢用 DeepSeek 处理编程,因为它说话的方式。" – @mosura
"这个版本最好的一点是它是在 codex harness 中训练的。它使用 codex 工具的感觉和 OpenAI 模型一样好,但极其便宜,且支持 1M 上下文。" – @tarruda
低资源可访问性
即使是量化后的 GGUF Q8 K XL 变体,也能轻松运行在 256 GB DRAM 服务器上,使没有 GPU 的用户也能在仅 CPU 的硬件上整夜运行该模型。
"如果你完全没有 GPU,且能接受设置一个处理低每秒标记速度的工作流,那就给它一个任务,4-6 小时后再回来查看,它运行得非常好。" – @walrus01
性能注意事项
尽管基准测试成绩令人印象深刻,但多位用户指出存在回归和边缘情况失败问题:
- 无限循环与自言自语:部分用户在使用某些代理时,发现模型陷入重复循环或生成无关内容。
- 冗长性变化:最近一次更新似乎增加了标记使用量,并使响应更加冗长,影响了成本和简洁性。
- 视觉谜题推理:尽管 ARC‑AGI‑2 得分强劲,但该模型缺乏多模态输入,引发了关于其如何仅通过文本推理解决视觉谜题的疑问。
"我遇到过大量问题,它会陷入无限循环并自言自语,却不执行工具调用,浪费了大量标记……它仍然值得,但就我的经验而言,其代理性能有所下降。" – @nylonstrung
"该模型变得更为自大和过度解释。虽然重新调整提示有所帮助,但也许这就是在编码和 ARC‑AGI 方面表现更好所必须付出的代价?" – @momojo
社区情绪
Hacker News 上的整体情绪非常积极,该帖子获得了 779 个赞 和 466 条评论。用户庆祝该模型的 性价比、本地部署能力 以及其在自动化方面的实用性(例如 CI 测试生成、日志监控、社交媒体内容重排序)。少数用户对 行为不一致 和 潜在的未来涨价 表示失望。
"DeepSeek 已宣布即将出现‘显著涨价’,所以这条线可能很快就要向右移动了。" – @modeless
"Kimi K3 上个月还是一款有趣的模型,现在我们却能以 1/20 的价格获得相同性能。这进步速度真是惊人。" – @542458
结论
DeepSeek V4 Flash 0731 为 2026 年中旬的 高精度、低成本大语言模型推理 设定了新标杆。其 89.0% 的 ARC‑AGI‑1 和 61.4% 的 ARC‑AGI‑2 得分展示了具有竞争力的推理能力,而其每项任务低于 1 美分的定价、快速的 CPU/GPU 吞吐量以及强大的编程辅助能力,使其成为爱好者和企业代理的实用选择。用户应留意偶尔的性能回归,并关注未来的定价变动,但目前该模型无疑是通往接近最先进语言模型性能的最具成本效益路径之一。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch