DeepSeek-V3-0324 发布说明

DeepSeek 发布了 DeepSeek-V3-0324,这是 R1 推理模型底层基座模型的更新版本。此次发布重点在于增强指令遵循、数学推理和编程能力,同时将模型转为 MIT 许可证。

性能基准测试与能力

DeepSeek-V3-0324 在关键基准测试中表现出强劲的性能,表现经常与 GPT-4.5 持平,并普遍超过 Claude-Sonnet-3.7。

基准测试改进

该模型在以下领域的表现较之前版本有显著提升:

  • MMLU-Pro: 从 75.9 增加到 81.2 (+5.3),表明整体理解能力有所提高。
  • GPQA: 从 59.1 增加到 68.4 (+9.3)。
  • AIME: 从 39.6 增加到 59.4 (+19.8),作为数学能力的指标。
  • LiveCodeBench: 从 39.2 增加到 49.2 (+10.0),表明编程能力有所提高。

针对性功能增强

DeepSeek 在以下领域确定了具体的改进:

  • 前端 Web 开发: 增强了代码的可执行性和游戏前端及网页的美观度。
  • 中文写作能力: 提升了中长篇写作的风格和内容质量,与 R1 的写作风格保持一致,并优化了翻译和书信写作。
  • 中文搜索能力: 为报告分析请求提供更详细的输出。
  • Function Calling: 提高了准确性并解决了之前 V3 版本中存在的问题。

技术实现

虽然尚未发布完整的技术报告,但该模型保持了与原始 DeepSeek-V3 相同的架构。据推测,这些改进是通过以下方式实现的:

  • 持续预训练: 利用更新、更高质量且经过更好筛选的数据来提高通用能力以及对近期事件的事实准确性。
  • 改进的后训练: 通过优化后训练的数据混合或算法来增强指令遵循和风格。

部署与推理选项

根据可用的计算资源,DeepSeek-V3-0324 可以通过多种方法进行部署:

托管推理

该模型可通过 Hugging Face Inference Providers 提供,包括 Fireworks, Hyperbolic, 和 Novita。

自托管推理

  • Text Generation Inference (TGI): 在最新版本 (v3.2.1) 中得到支持,并可以通过 Docker 在 H100 节点上运行。
  • SGLang: 原生支持该模型,并具有 Multi Latent Attention 和 Data Parallelism 优化。

针对低显存的量化方案

为了降低全量模型的显存要求,Unsloth AI 提供了 Dynamic Quantizations。这些方案允许模型通过 llama.cpp 以仅单台 H100 节点一半的计算量运行,且基准测试性能下降极小。

安全与安全考虑

模型分发安全

由于 Hugging Face Hub 的多项保障措施,下载并运行该模型被认为是安全的:

  • Safetensors: 使用 safetensors 格式可以防止隐藏代码执行,这是与旧版 PyTorch pickle 格式相关的风险。
  • 建模代码安全: 代码在 hub 上完全可见,要求用户设置 trust_remote_code=True 才能执行,并接受安全扫描。用户可以通过使用 revision 设置来固定模型版本,从而进一步保障环境安全。

输出与使用风险

用户在使用模型输出时应采取标准的安全性措施:

  • 对齐: 用户应意识到所有 LLM 都基于模型提供商的对齐值存在偏见。
  • 代码生成: 建议对生成的代码进行彻底审查和漏洞扫描,因为模型可能会生成包含其训练数据中已知漏洞的代码。
  • 智能体 (Agents): 在将模型用于自主智能体时,建议使用沙箱环境以防止未经授权的系统访问,避免共享私密凭据,并在高风险流程中保持人工干预 (human-in-the-loop)。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch