DeepSeek-V3.2-Exp 發佈說明
DeepSeek 已推出 DeepSeek-V3.2-Exp,這是一款旨在優化長文本上下文性能並降低營運成本的實驗性模型。此版本引入了 DeepSeek Sparse Attention (DSA),這是一種能在保持其前身 V3.1-Terminus 輸出品質的同時,實現更快速訓練與推理的機制。
DeepSeek Sparse Attention (DSA) 與效率
DeepSeek Sparse Attention (DSA) 實作了細粒度的稀疏注意力機制,以在處理長文本上下文時降低計算成本並提升性能。根據 DeepSeek 的說法,DSA 在對輸出品質影響極小的情況下實現了這些效率增益。基準測試顯示,DeepSeek-V3.2-Exp 的表現與 V3.1-Terminus 持平。
API 定價與可用性
DeepSeek 已立即將 API 價格降低了 50% 以上。新模型已可在 DeepSeek App、Web 介面及 API 中使用。為了便於進行對比測試,V3.1-Terminus 模型將透過臨時 API 持續提供,直到 2025 年 10 月 15 日 15:59 UTC。
開源與技術資源
DeepSeek-V3.2-Exp 已作為開源版本發佈。該公司已為開發者與研究人員提供以下資源:
- Model Weights: 可於 Hugging Face 上取得。
- Technical Report: 詳細文件託管於 GitHub。
- GPU Kernels: 關鍵的 GPU kernels 已在 TileLang 與 CUDA 中提供,其中推薦使用 TileLang 進行快速的研究原型開發。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch