DeepSeek V4 Pro: 以永久降價顛覆 LLM 市場

大型語言模型 (LLM) 的定價格局正在迅速變化。DeepSeek 最近宣布其 V4 Pro 模型的價格折扣將成為永久性措施,這標誌著這不僅僅是一次暫時性的促銷,而是在 AI 推論經濟學方面的根本性轉變。透過將價格降至原始成本的一小部分,DeepSeek 正將自己定位為 OpenAI 和 Anthropic 等既有巨頭的高性能、低成本替代方案。

此舉在開發者和工程師之間引發了關於此類定價的可行性、效率背後的技術原因,以及在中國託管模型的地緣政治影響的廣泛討論。

新的定價結構

DeepSeek 更新後的 V4 系列定價旨在具備極強的競爭力。特別是 V4 Pro 模型,其價格已調整為原始成本的 25%。

V4 Pro 定價明細

  • Input Tokens (Cache Miss): $0.435 per 1M tokens (down from $1.74)
  • Output Tokens: $0.87 per 1M tokens (down from $3.48)
  • Input Tokens (Cache Hit): $0.003625 per 1M tokens

為了提供一個直觀的對比,社群的比較顯示了 V4 Pro 與其他旗艦模型之間的巨大差異。例如,雖然 DeepSeek V4 Pro 每 1M output tokens 的成本為 $0.87,但競爭對手如 GPT-5.5 和 Opus 4.7 的成本分別被引用為 $30.00 和 $25.00。

V4 Flash: 效率的動力源

雖然 V4 Pro 處理複雜推理,但 V4 Flash 模型因其速度和更低的成本,仍然是代理型 (agentic)、工具密集型工作負載的首選。隨著 input cache hits 降至發布價格的 1/10,V4 Flash 提供極高的性價比,使其成為高容量應用的理想選擇。

技術賦能者:為什麼這麼便宜?

觀察家之間的一個常見問題是,這究竟是一場為了獲取市場份額的「價格戰」,還是真實技術效率的結果。一些技術見解表明是後者。

一位貢獻者指出,DeepSeek 的 MLA (Multi-head Latent Attention) 架構 是這些成本的關鍵驅動因素:

"their MLA architecture cuts KV cache by ~5-13x vs standard attention. that's why inference is actually cheaper to run, not just a price war to gain market share."

透過顯著減少 KV cache 的需求,DeepSeek 可以使用更少的硬體資源進行推論,從而能夠在不犧牲服務財務可行性的情況下降低價格點。

開發者情緒與使用案例

開發者對 V4 系列表示高度滿意,特別是在編碼任務方面。一些用戶發現 V4 Pro 在處理複雜任務時優於其他專門的編碼模型,一位用戶報告其 65 million tokens 的成本僅為 $1.5。

已識別的關鍵使用案例:

  • Complex Coding: 使用 V4 Pro 進行深度推理和複雜的架構任務。
  • Secondary Code Checks: 利用該模型來發現其他模型可能會遺漏的 bug 或邊緣案例。
  • Hybrid Workflows: 將高端規劃模型 (如 Opus 4.7) 與 V4 Flash 進行執行,以優化品質與成本。
  • Agentic Workflows: 利用 V4 Flash 的 1M context window 和 tool-calling 能力來構建自主代理。

批判性觀點與擔憂

儘管充滿熱情,此舉在專業社群中也引發了幾種擔憂。

數據隱私與地緣政治

由於 DeepSeek 是由中國託管的模型,一些開發者對數據隱私和政府監控的可能性表示猶豫。擔憂範圍從意外的數據洩漏 (例如環境文件被代理讀取) 到該地區數據隱私的廣泛歷史問題。

Token 消耗量

一些用戶指出,雖然單個 token 的價格很低,但該模型可能會以比競爭對手更高的速率「消耗 token」,這可能會根據提示詞 (prompt) 和輸出風格,抵消掉部分成本節省。

市場永續性

關於這種定價是否具有永續性,仍存在爭議。有人推測 DeepSeek 是在玩一場「長期戰」,透過讓高性能 AI 變得極其廉價,來顛覆美國為主的競爭對手,透過建立一個只有具備極端架構效率的廠商才能生存的市場。

Sources