DeepSeek-V3.2-Exp 发布说明
DeepSeek 已发布 DeepSeek-V3.2-Exp,这是一款实验性模型,旨在优化长上下文性能并降低运营成本。此版本引入了 DeepSeek 稀疏注意力(DSA)机制,可在保持其前代模型 V3.1-Terminus 输出质量的同时,实现更快的训练和推理速度。
DeepSeek 稀疏注意力(DSA)与效率
DeepSeek 稀疏注意力(DSA)通过实现细粒度稀疏注意力,降低了计算成本,并提升了长上下文处理的性能。据 DeepSeek 称,DSA 在对输出质量影响极小的情况下实现了这些效率提升。基准测试表明,DeepSeek-V3.2-Exp 的表现与 V3.1-Terminus 相当。
API 定价与可用性
DeepSeek 已立即下调 API 价格超过 50%。新模型已在 DeepSeek App、Web 界面和 API 中上线。为便于对比测试,V3.1-Terminus 模型将通过临时 API 服务持续提供,直至 2025 年 10 月 15 日 15:59 UTC。
开源与技术资源
DeepSeek-V3.2-Exp 已作为开源版本发布。公司为开发者和研究人员提供了以下资源:
- 模型权重:可在 Hugging Face 上获取。
- 技术报告:详细文档托管于 GitHub。
- GPU 内核:关键 GPU 内核以 TileLang 和 CUDA 形式提供,建议使用 TileLang 进行快速研究原型开发。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch