DeepSeek-V4.1-Flash 发布说明
DeepSeek-V4.1-Flash 是一款专为高吞吐量和更低推理成本而设计的多模态模型。它引入了一种新的非对称架构,将输入处理(prefill)与输出生成(decode)分离,使模型在每个 token 时能以显著更少的活跃参数运行。
架构创新
DeepSeek-V4.1-Flash 采用了 Causal Encoder-Decoder (CED) 架构。这个 40 层的 Transformer 被组织为 20 层的因果编码器(causal encoder)后接 20 层的解码器(decoder)。
关键技术规格包括:
- 参数量:该模型是一个 552B 参数的混合专家模型 (MoE)。
- 活跃参数:CED 设计允许在 prefill(输入)阶段仅使用 8B 活跃参数,在 decoding(输出)阶段使用 16B 活跃参数。
- KV Cache 优化:全局 KV cache 足迹减少到每个 token 890 字节,约为之前 DeepSeek-V4-Flash 代际所需内存的 1/4。这导致 HBM 使用量减少为 1/4,SSD 存储需求减少为 1/8。
- 多模态支持:该模型具有原生视觉理解能力,将视觉能力直接集成到 Flash 架构中。
性能与部署
DeepSeek-V4.1-Flash 可通过 DeepSeek API(模型名称:deepseek-flash)获取,并已作为开源权重发布在 Hugging Face 上。
推理与成本
- 推理强度:该模型支持可控的推理强度设置(整数 1–100),允许用户在推理成本与提高准确性之间进行权衡。
- 定价:DeepSeek 引入了高峰和低谷时段定价以平衡需求,低谷时段的费率设定为高峰时段的 50%。
- 缓存命中:架构的效率带来了极低的缓存命中费用,这显著降低了重度依赖缓存上下文的智能体 (agentic) 工作负载的成本。
本地部署的硬件要求
社区讨论指出,552B 的参数量使得本地部署具有挑战性。用户指出,4-bit 量化 (q4) 将需要超过 256GB 的 RAM/VRAM 来加载模型,这可能需要高端硬件,例如配备四通道内存的 Threadripper 系统或多 GPU 集群。
社区见解与对比
用户和研究人员针对 V4.1-Flash 的发布提出了几点关键结论:
"Every single model release is packed with new and crazy clever ideas and somehow, they always commit to training them at near frontier scale."
虽然基准测试显示出强大的性能——特别是在智能体 (agentic) 分数和 Cyberbench 中——但一些用户提醒,基准测试并不总是与现实世界的智能完全相关。与其他模型(如 GPT-5.6 Sol 和 Gemini 3.8 Flash)的对比表明,虽然 V4.1-Flash 在自动化和编程方面极具竞争力,但在某些特定的高推理基准测试(如 GPQA Diamond)中可能会稍显落后。
此外,一些用户报告了移动端 App 的语言设置问题,指出模型有时即使在提示词为英文时也会用中文回答。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch