DeepSeek-V4-Flash-0731-Latent-Reasoning 發佈說明
DeepSeek-V4-Flash-0731-Latent-Reasoning 是一個特殊的模型實作,它將「思考」過程移至潛在空間(latent space)。透過將推理 token 壓縮並保持在潛在形式而非以文本形式輸出,該模型在優化推理過程的同時,透過自定義的 vLLM fork,維持了具備生產就緒能力的服務運行時環境。
性能與評估
在 BIG-Bench Hard (BBH) cot_zeroshot 基準測試的 27 個子任務中,該模型取得了 0.880 的總分(測量範圍為 0.94 0.008)。
推理優勢與劣勢
- 高熟練度: 模型在多步狀態追蹤方面表現最強。例如
tracking_shuffled_objects、boolean_expressions、formal_fallacies和penguins_in_a_table等子任務均取得了 1.00 的滿分。 - 顯著劣勢: 模型在處理機械式、語法密集型的任務時表現吃力。
dyck_languages(括號匹配)子任務得分為 0.26,顯示在結構化語法處理方面存在真正的推理失敗。
技術架構
該模型利用變分壓縮頭(variational compression head)來處理潛在推理。其架構運作方式是從第 35 層提取隱藏狀態(hidden states),並在將結果寫回凍結的 NVFP4 DeepSeek-V4-Flash-0731 主幹網路的殘差流(residual stream)之前,透過 ReasoningCompressionHead 和 LatentDecoder 進行處理。
組件規格
- 隱藏層大小 (Hidden Size): 4096
- 潛在維度 (Latent Dimension): 1024
- MLP 維度 (MLP Dimension): 2048
- 來源/目標層 (Source/Target Layers): 35 / 42
- 激活函數 (Activation): SiLU
- 參數: 該頭部與解碼器包含 35.7M float32 參數(約 152 MB)。
- 停止頭 (Stop Head): 使用一個學習到的停止頭來確定推理階段的結束。
部署與服務
由於標準 vLLM 無法服務此模型,因為 DeepSeek-V4 路由 MoE 專家的方式(這需要通常在 prompt_embeds 路徑中被設為 null 的 input_ids),因此需要使用自定義的 fork 版本。
所需基礎設施
- 硬體: 由於 NVFP4 量化和特定的稀疏-MLA 核心路徑,必須使用 Blackwell 級別的硬體 (sm120)。
- 顯存 (VRAM) 需求:
- 針對長上下文 (256k),建議使用 ≥ 192 GiB(例如 2× 96 GiB)。
- 160–192 GiB 是可行的,但需要將
MAX_MODEL_LEN降低至 32k–64k。 - ≠ < 160 GiB 對於 NVFP4 權重來說是不夠的。
服務實作
服務由 ds4-reasoning-addon 和特定的 vLLM fork (vllm-ds4-sm120) 管理。系統透過在目標位置覆寫 embed_tokens 輸出,將解碼後的潛在向量注入,從而允許 token ID 正常流動以進行 hash-MoE 路由,同時維持 cudagraph 的快速路徑。
運行時配置與客戶端使用
關鍵客戶端要求
為了避免退化輸出,客戶端必須透過 chat_template_kwargs 或特定的標頭來明確要求思考過程:
- 必要參數: `extra_body={
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch