DeepSeek-V4.1-Flash 发布说明

DeepSeek-V4.1-Flash 是一款多模态专家混合(MoE)模型,旨在实现更高的吞吐量、更快的推理速度以及原生的视觉理解能力。它采用了一种非对称架构,使其在性能上超越了之前的旗舰模型(包括 DeepSeek-V4-Pro),同时降低了运营成本。

非对称架构与模型智能

DeepSeek-V4.1-Flash 采用 552B 参数的 MoE 结构,并引入了新的因果编码器-解码器架构。该设计通过仅使用 8B 激活参数处理输入,以及 16B 激活参数生成输出,优化了资源分配。

智能提升得益于新的预训练方法和更大规模的强化学习(RL)后训练。据 DeepSeek 称,这些改进使 V4.1-Flash 在基准测试中的表现超过了 DeepSeek-V4-Pro 旗舰模型。

KV 缓存优化与成本降低

与上一代相比,DeepSeek-V4.1-Flash 显著降低了其键值(KV)缓存的内存和存储需求。该模型目前需要:

  • 之前所需高带宽内存(HBM)的 1/4。
  • 之前所需 SSD 存储的 1/8。

这种 KV 缓存的压缩专门针对降低缓存命中费用,DeepSeek 指出,这类费用通常占基于代理的运营成本的很大一部分。

API 集成与模型生命周期

DeepSeek-V4.1-Flash 现已通过 DeepSeek API 提供,模型标识符为 deepseek-flash。此次发布包含以下生命周期变更:

  • 退役: V4-Flash 和 V4-Flash-Vision-Exp 已正式退役。
  • 兼容性: 发送到 deepseek-v4-flashdeepseek-v4-flash-vision-exp 的请求将暂时重定向至 V4.1-Flash。
  • V4-Pro 过渡: DeepSeek 正逐步淘汰 V4-Pro。从 2026 年 9 月 14 日 04:00 UTC 开始,所有 deepseek-v4-pro 请求将被重定向至 V4.1-Flash,按 V4.1-Flash 的定价运行,直至 V4.1-Pro 发布。

官方合作伙伴 WorkBuddy(含 CodeBuddy)和 OpenCode 现已全面支持 V4.1-Flash。

定价与部署

DeepSeek 已于 2026 年 9 月 10 日 04:00 UTC 起实施新定价策略,理由是 V4.1-Flash 架构的高效性。定价模式继续采用高峰和低谷时段费率,低谷时段费率设定为高峰时段费率的 50%,以平衡需求。

对于开源部署,模型和技术报告已在 Hugging Face 上提供。DeepSeek 还为需要 2,000 块 GPU 和存储集群的大规模部署提供咨询服务。

Sources