DeepSeek-V4.1-Flash 发布说明
DeepSeek-V4.1-Flash 是一款多模态专家混合(MoE)模型,旨在实现更高的吞吐量、更快的推理速度以及原生的视觉理解能力。它采用了一种非对称架构,使其在性能上超越了之前的旗舰模型(包括 DeepSeek-V4-Pro),同时降低了运营成本。
非对称架构与模型智能
DeepSeek-V4.1-Flash 采用 552B 参数的 MoE 结构,并引入了新的因果编码器-解码器架构。该设计通过仅使用 8B 激活参数处理输入,以及 16B 激活参数生成输出,优化了资源分配。
智能提升得益于新的预训练方法和更大规模的强化学习(RL)后训练。据 DeepSeek 称,这些改进使 V4.1-Flash 在基准测试中的表现超过了 DeepSeek-V4-Pro 旗舰模型。
KV 缓存优化与成本降低
与上一代相比,DeepSeek-V4.1-Flash 显著降低了其键值(KV)缓存的内存和存储需求。该模型目前需要:
- 之前所需高带宽内存(HBM)的 1/4。
- 之前所需 SSD 存储的 1/8。
这种 KV 缓存的压缩专门针对降低缓存命中费用,DeepSeek 指出,这类费用通常占基于代理的运营成本的很大一部分。
API 集成与模型生命周期
DeepSeek-V4.1-Flash 现已通过 DeepSeek API 提供,模型标识符为 deepseek-flash。此次发布包含以下生命周期变更:
- 退役: V4-Flash 和 V4-Flash-Vision-Exp 已正式退役。
- 兼容性: 发送到
deepseek-v4-flash和deepseek-v4-flash-vision-exp的请求将暂时重定向至 V4.1-Flash。 - V4-Pro 过渡: DeepSeek 正逐步淘汰 V4-Pro。从 2026 年 9 月 14 日 04:00 UTC 开始,所有
deepseek-v4-pro请求将被重定向至 V4.1-Flash,按 V4.1-Flash 的定价运行,直至 V4.1-Pro 发布。
官方合作伙伴 WorkBuddy(含 CodeBuddy)和 OpenCode 现已全面支持 V4.1-Flash。
定价与部署
DeepSeek 已于 2026 年 9 月 10 日 04:00 UTC 起实施新定价策略,理由是 V4.1-Flash 架构的高效性。定价模式继续采用高峰和低谷时段费率,低谷时段费率设定为高峰时段费率的 50%,以平衡需求。
对于开源部署,模型和技术报告已在 Hugging Face 上提供。DeepSeek 还为需要 2,000 块 GPU 和存储集群的大规模部署提供咨询服务。