DeepSeek V4 Flash 0731 在每項任務僅需 $0.02 至 $0.04 的情況下,於 ARC‑AGI 基準測試中取得 89% 的 ARC‑AGI‑1 與 61.4% 的 ARC‑AGI‑2 成績
概述
DeepSeek V4 Flash 0731 在 ARC‑AGI 基準測試套件中表現卓越——在 ARC‑AGI‑1(半私有)上取得 89.0% 的成績,在 ARC‑AGI‑2(半私有)上取得 61.4% 的成績,每項任務的費用分別為 $0.02 與 $0.04。這些數值使其成為表現最出色的系統之一,同時推理成本比許多專有替代方案低一個數量級。
基準測試結果
官方的 ARC‑AGI 排行榜報告了 DeepSeek V4 Flash 0731 的三種推理變體:
| 變體 | ARC‑AGI‑1 | ARC‑AGI‑2 | ARC‑AGI‑3 |
|---|---|---|---|
| 最大 | 89.0% | 61.4% | — |
| 高 | 87.0% | 56.0% | — |
| 低 | 84.0% | 46.0% | — |
「最大」變體使用最激進的推理設定,在兩項基準測試中均超越「高」與「低」配置。截至撰寫時,該模型尚未報告 ARC‑AGI‑3 的成績。
任務層級通過/失敗(ARC‑AGI‑2 公開評估)
在 120 項公開評估任務中,「最大」變體通過 73 題,「高」變體通過 71 題,「低」變體通過 58 題。詳細的通過/失敗矩陣顯示,該模型在邏輯推論與程式碼推理任務上表現穩定,但部分視覺謎題類型任務仍具挑戰性。
成本效益
DeepSeek V4 Flash 0731 在「最大努力」定價層級下,對 ARC‑AGI‑1 任務收費 $0.02,對 ARC‑AGI‑2 任務收費 $0.04。根據提供者引用的快取定價模型,這相當於每 1 M 個 token 約 $0.02–$0.04。社群成員反覆強調其可忽略的營運成本:
"我在 Oh My Pi 上運行它,另啟動一個第二個執行個體作為 "顧問",即使有 5–6 個活躍會話,我每天花費也難以超過 5 美元。" – @LaurensBER
"DeepSeek 是我用於 API 的便宜又愉快的中國模型首選。更便宜,現在甚至比 Pro 版還好……不是最頂尖的,但整體表現比同價位模型強大許多。" – @SwellJoe
實際應用洞察
速度與可部署性
使用者報告,該模型在雙 RTX 6000 Blackwell 系統上可達 ~8 k tokens/s 的預填速度 與 ~250 tokens/s 的生成速度,透過 vLLM 使用 64 個併發串流時可擴展至 ~1 k tokens/s。此吞吐量可實現無明顯延遲的互動式對話,並支援大規模代理部署。
"在 2x RTX Pro 6000 Blackwell 上,其預填速度約為 8k tok/s,單串流生成速度約為 250 tok/s。我在 vLLM 上看到約 64 個併發串流時達到 1000 tok/s。速度足夠快,讓你可以在等待時直接與它互動,無需切換分頁。" – @ak_t
程式設計與工具使用
該模型因其程式設計協助與工具呼叫能力而受到讚譽,經常在日常開發工作流程中超越更大規模的專有模型。
"我強烈建議嘗試用它處理程式設計任務。它在程式設計方面表現強勁(雖不及 Fable 那樣強),但比 Opus 更具『個性』,且盲點也完全不同。……總體而言,我現在更偏好 DeepSeek 用於程式設計,因為它說話的方式。" – @mosura
"這個版本最棒的一點是,它是在 codex harness 中訓練的。使用 codex 工具時感覺與 OpenAI 模型一樣好,但極其便宜,且支援 1M 上下文。" – @tarruda
低資源可及性
即使是最小化的 GGUF Q8 K XL 量化版本,也能輕鬆安裝在 256 GB DRAM 伺服器上,讓沒有 GPU 的使用者也能在僅 CPU 的硬體上 overnight 執行模型。
"如果你完全沒有 GPU,且願意設置一個能處理低每秒 token 速率的工作流程,給它一個任務,4–6 小時後回來查看,它運作得非常好。" – @walrus01
性能限制
儘管基準測試成績令人印象深刻,但多位使用者指出存在退化與邊際案例失敗問題:
- 無限循環與自我對話:部分使用者在搭配特定代理使用時,發現模型陷入重複循環或產生無關內容。
- 語氣過於冗長:近期更新似乎增加了 token 使用量,使回應更冗長,影響成本與簡潔性。
- 視覺謎題推理:儘管 ARC‑AGI‑2 成績出色,但該模型缺乏多模態輸入,令人懷疑其如何僅透過文字推理解決視覺謎題。
"我遇到大量問題,它會陷入無限循環並自我對話,卻不執行工具呼叫,浪費大量 token……雖然仍值得使用,但就我的經驗而言,代理性能已有所退化。" – @nylonstrung
"這模型變得更加自誇且過度解釋。重寫提示語有幫助,但或許這就是更擅長程式設計與 ARC‑AGI 的代價?" – @momojo
社群意見
整體而言,Hacker News 上的意見極為正面,該貼文獲得 779 個讚 與 466 則留言。使用者慶祝該模型的 性價比、本地部署能力,以及其在自動化應用中的實用性(例如 CI 測試生成、日誌監控、社群媒體訊息重排序)。少數使用者對 行為不一致 與 未來可能的定價上漲 表示失望。
"DeepSeek 已宣布即將進行『顯著上漲』定價,因此這條線可能很快就得往右移了。" – @modeless
"Kimi K3 上個月還是一個有趣的模型,現在我們卻能以 1/20 的價格獲得相同表現。這進步速度實在太快了。" – @542458
結論
DeepSeek V4 Flash 0731 在 2026 年中樹立了 高準確率、低成本大語言模型推理 的新基準。其 89.0% 的 ARC‑AGI‑1 與 61.4% 的 ARC‑AGI‑2 成績展現出競爭力的推理能力,加上每項任務低於一美分的定價、快速的 CPU/GPU 吞吐量,以及強大的程式設計支援,使其成為個人愛好者與企業代理的實用選擇。使用者應留意偶發的退化問題,並關注未來的定價變動,但目前該模型仍是通往近似最尖端語言模型性能的最具成本效益途徑之一。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch