DeepSeek-V4.1-Flash 發布說明

DeepSeek-V4.1-Flash 是一款多模態混合專家(MoE)模型,專為更高的吞吐量、更快的推論速度以及原生的視覺理解而設計。它採用非對稱架構,使其在降低運營成本的同時,性能超越先前的旗艦模型,包括 DeepSeek-V4-Pro。

非對稱架構與模型智慧

DeepSeek-V4.1-Flash 使用 552B 參數的 MoE 結構,並搭配全新的因果編碼器-解碼器架構。此設計透過僅使用 8B 活躍參數處理輸入,以及 16B 活躍參數生成輸出,優化資源配置。

智慧提升來自於新預訓練方法與更大規模的強化學習(RL)後訓練的結合。根據 DeepSeek 的說法,這些改進使 V4.1-Flash 在基準測試中的表現超越了 DeepSeek-V4-Pro 旗艦模型。

KV 快取優化與成本降低

DeepSeek-V4.1-Flash 相較於前一代,大幅降低了其鍵值(KV)快取所需的記憶體與儲存空間。該模型目前僅需:

  • 原先所需高頻寬記憶體(HBM)的 1/4。
  • 原先所需 SSD 儲存空間的 1/8。

此快取壓縮專注於降低快取命中所產生的費用,DeepSeek 指出,這類費用通常佔代理運營成本的很大一部分。

API 整合與模型生命周期

DeepSeek-V4.1-Flash 現已透過 DeepSeek API 提供,模型識別碼為 deepseek-flash。此次發布包含以下生命周期變更:

  • 停用: V4-Flash 與 V4-Flash-Vision-Exp 已正式停用。
  • 相容性: 發送到 deepseek-v4-flashdeepseek-v4-flash-vision-exp 的請求將暫時導向 V4.1-Flash。
  • V4-Pro 迁移: DeepSeek 正逐步淘汰 V4-Pro。自 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 請求將導向 V4.1-Flash,並以 V4.1-Flash 的定價執行,直至 V4.1-Pro 發布為止。

官方合作夥伴 WorkBuddy(含 CodeBuddy)與 OpenCode 現已全面支援 V4.1-Flash。

價格與部署

DeepSeek 已於 2026 年 9 月 10 日 04:00 UTC 起實施新定價,理由是 V4.1-Flash 架構的效率。定價模式仍採用高峰與非高峰時段定價,非高峰時段定價為高峰時段的 50%,以平衡需求。

對於開源部署,模型與技術報告已在 Hugging Face 上提供。DeepSeek 亦提供針對需要 2,000 張 GPU 與儲存叢集的大規模部署之諮詢服務。

Sources