DeepSeek-V3-0324 發佈說明

DeepSeek 已發佈 DeepSeek-V3-0324,這是 R1 推理模型底層基礎模型的更新版本。此版本專注於增強指令遵循、數學推理和程式碼能力,同時將模型轉換為 MIT 授權。

效能基準測試與能力

DeepSeek-V3-0324 在關鍵基準測試中展現了強大的效能,表現經常與 GPT-4.5 持平,且通常優於 Claude-Sonnet-3.7。

基準測試改進

該模型在以下領域較先前版本有顯著提升:

  • MMLU-Pro: 從 75.9 增加到 81.2 (+5.3),顯示整體理解能力的提升。
  • GPQA: 從 59.1 增加到 68.4 (+9.3)。
  • AIME: 從 39.6 增加到 59.4 (+19.8),作為數學能力的指標。
  • LiveCodeBench: 從 39.2 增加到 49.2 (+10.0),顯示程式碼能力的提升。

目標功能增強

DeepSeek 在以下領域確定了特定的改進:

  • 前端網頁開發: 增強了程式碼的可執行性以及遊戲前端和網頁的美感品質。
  • 中文寫作能力: 改進了中長篇寫作的風格與內容品質,與 R1 的寫作風格保持一致,並優化了翻譯與書信寫作。
  • 中文搜尋能力: 為報告分析請求提供更詳細的輸出。
  • Function Calling: 提高了準確度並解決了先前 V3 版本中存在的問題。

技術實作

雖然尚未發佈完整的技術報告,但該模型維持與原始 DeepSeek-V3 相同的架構。據推測,這些改進是透過以下方式實現的:

  • 持續預訓練 (Continual Pretraining): 利用更新、更高品質且經過更好篩選的數據來提升通用能力以及對近期事件的事實性。
  • 改進的後訓練 (Improved Post-Training): 精煉後訓練的數據混合比例或演算法,以增強指令遵循與風格。

部署與推論選項

DeepSeek-V3-0324 可透過幾種方法部署,具體取決於可用的運算資源:

託管式推論

該模型可透過 Hugging Face Inference Providers 使用,包括 Fireworks, Hyperbolic, 以及 Novita。

自託管式推論

  • Text Generation Inference (TGI): 在最新版本 (v3.2.1) 中提供支援,並可透過 Docker 在 H100 節點上執行。
  • SGLang: 原生支援該模型,並具備 Multi Latent Attention 與 Data Parallelism 優化。

針對低 VRAM 的量化技術

為了降低全模型的高 VRAM 需求,Unsloth AI 提供了動態量化 (Dynamic Quantizations)。這些技術允許模型透過 llama.cpp 以僅一半的單一 H100 節點運算量執行,且基準測試效能降幅極小。

安全與安全考量

模型分發安全性

由於 Hugging Face Hub 的幾項保障措施,下載並執行該模型被認為是安全的:

  • Safetensors: 使用 safetensors 格式可防止隱藏程式碼執行,這是與舊版 PyTorch pickle 格式相關的風險。
  • 建模程式碼安全性: 程式碼在 hub 上完全透明,需要使用者設定 trust_remote_code=True 才能執行,並受到安全掃描器的檢測。使用者可以透過使用 revision 設定來固定模型版本,進一步確保環境安全。

輸出與使用風險

使用者在使用模型輸出時應採取標準的安全措施:

  • 對齊 (Alignment): 使用者應意識到所有 LLM 都會根據模型提供者的對齊價值觀而產生偏誤。
  • 程式碼生成: 建議對生成的程式碼進行徹底審查與漏洞掃描,因為模型可能會生成包含其訓練數據中已知漏洞的程式碼。
  • 代理人 (Agents): 在將模型用於自主代理人時,建議使用沙盒環境以防止未經授權的系統存取,避免分享私密憑證,並在高風險流程中保持「人機協作 (human-in-the-loop)」模式。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch