DeepSeek-V4.1-Flash 發佈說明
DeepSeek-V4.1-Flash 是一款專為高吞吐量和更低推理成本而設計的多模態模型。它引入了一種新的非對稱架構,將輸入處理(prefill)與輸出生成(decode)分離,使模型在每個 token 時能以顯著減少的活躍參數進行運作。
架構創新
DeepSeek-V4.1-Flash 使用了 Causal Encoder-Decoder (CED) 架構。這個 40 層的 Transformer 被組織為 20 層因果編碼器(causal encoder)後接 20 層解碼器(decoder)。
關鍵技術規格包括:
- 參數數量:該模型是一個 552B 參數的混合專家模型(Mixture-of-Experts, MoE)。
- 活躍參數:CED 設計允許在 prefill(輸入)階段僅使用 8B 活躍參數,並在 decoding(輸出)階段使用 16B 活躍參數。
- KV Cache 優化:全域 KV cache 佔用量減少至每個 token 890 bytes,約為前代 DeepSeek-V4-Flash 所需記憶體的 1/4。這使得 HBM 使用量減少至 1/4,且 SSD 儲存需求減少至 1/8。
- 多模態支持:該模型具備原生視覺理解能力,將視覺功能直接整合到 Flash 架構中。
性能與部署
DeepSeek-V4.1-Flash 可透過 DeepSeek API(模型名稱:deepseek-flash)使用,並已在 Hugging Face 上以開源權重形式發佈。
推理與成本
- 推理強度:模型支持可控的推理強度設置(整數 1–100),允許用戶在推理成本與提高準確度之間進行權衡。
- 定價:DeepSeek 引入了尖峰與離峰時段定價,以平衡需求,離峰時段的費率設定為尖峰時段的 50%。
- 快取命中:架構的效率使得快取命中(cache-hit)費用極低,這顯著降低了高度依賴快取上下文(cached context)的智能體(agentic)工作負載的成本。
本地部署的硬體需求
社群討論指出,552B 的參數數量使得本地部署具有挑戰性。用戶指出,4-bit 量化(q4)將需要超過 256GB 的 RAM/VRAM 來加載模型,這可能需要高端硬體,例如配備四通道記憶體的 Threadripper 系統或多 GPU 集群。
社群洞察與比較
用戶和研究人員對 V4.1-Flash 的發佈提出了幾項關鍵觀察:
"Every single model release is packed with new and crazy clever ideas and somehow, they always commit to training them at near frontier scale."
雖然基準測試顯示出強大的性能——特別是在 agentic 分數和 Cyberbench 中——但一些用戶提醒,基準測試可能並不總是與現實世界的智能程度完美相關。與其他模型(如 GPT-5.6 Sol 和 Gemini 3.8 Flash)的比較顯示,雖然 V4.1-Flash 在自動化和編碼方面具有高度競爭力,但在某些特定的高推理基準測試(如 GPQA Diamond)中可能稍顯落後。
此外,一些用戶報告了行動裝置 App 的語言設置問題,指出模型偶爾會在收到英文提示時仍以中文回應。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch