DeepSeek-V4-Flash-0731-Latent-Reasoning 发布说明

DeepSeek-V4-Flash-0731-Latent-Reasoning 是一个专门的模型实现,它将“思考”过程移入潜空间(latent space)。通过压缩推理 token 并将其保持在潜形式而非以文本形式输出,该模型在优化推理过程的同时,通过自定义的 vLLM fork 维持了生产级的服务运行时。

性能与评估

在 BIG-Bench Hard (BBH) cot_zeroshot 基准测试的 27 个子任务中,该模型取得了 0.880 的综合得分(测量范围为 0.94 — 0.008)。

推理优势与劣势

  • 高熟练度: 模型在多步状态跟踪方面表现最强。诸如 tracking_shuffled_objectsboolean_expressionsformal_fallaciespenguins_in_a_table 等子任务均获得了 1.00 的满分。
  • 显著劣势: 模型在处理机械化、语法密集型任务时表现挣扎。dyck_languages(括号匹配)子任务得分为 0.26,表明在结构化语法处理方面存在真实的推理失败。

技术架构

该模型利用变分压缩头(variational compression head)来处理潜推理。其架构通过从第 35 层提取隐藏状态,并通过 ReasoningCompressionHead 和 LatentDecoder 进行处理,然后将结果写回冻结的 NVFP4 DeepSeek-V4-Flash-0731 主干网络的残差流中。

组件规格

  • 隐藏层大小 (Hidden Size): 4096
  • 潜维度 (Latent Dimension): 1024
  • MLP 维度: 2048
  • 源/目标层 (Source/Target Layers): 35 / 42
  • 激活函数: SiLU
  • 参数量: 该头部和解码器包含 35.7M float32 参数(约 152 MB)。
  • 停止头 (Stop Head): 使用一个学习到的停止头来确定推理阶段的结束。

部署与服务

由于标准 vLLM 无法通过 DeepSeek-V4 路由 MoE 专家的方式来提供服务(这需要通常在 prompt_embeds 路径中被置空的 input_ids),因此需要使用自定义 fork。

所需基础设施

  • 硬件: 由于 NVFP4 量化和特定的稀疏-MLA 内核路径,必须使用 Blackwell 级硬件 (sm120)。
  • 显存 (VRAM) 要求:
    • 对于长上下文 (256k),建议 $≥$ 192 GiB(例如 2$ imes$ 96 GiB)。
    • 160–192 GiB 是可行的,但需要将 MAX_MODEL_LEN 降低至 32k–64k。
    • $ eq$ < 160 GiB 对于 NVFP4 权重来说是不够的。

服务实现

服务通过 ds4-reasoning-addon 和特定的 vLLM fork (vllm-ds4-sm120) 进行管理。系统通过在目标位置覆盖 embed_tokens 输出的方式注入解码后的潜变量,从而允许 token ID 在进行 hash-MoE 路由时正常流动,同时维持 cudagraph 的快速路径。

运行时配置与客户端使用

关键客户端要求

为了避免退化输出,客户端必须通过 chat_template_kwargs 或特定的 header 请求显式思考:

  • 必需参数: extra_body={"chat_template_kwargs": {"thinking": True}} 或 header x-ds4-thinking: 1
  • Token 预算: 推理和回答共享单一的 token 预算。用户应使用较高的 MIN_OUTPUT_TOKENS(默认 4096)以防止潜阶段消耗掉整个 max_tokens 预算,从而导致回答为空。

服务器环境变量

  • MAX_LATENT:潜步骤的安全上限(默认 256)。
  • MIN_LATENT:潜步骤的下限,以防止“无思考”回答(默认 4)。
  • STOP_THRESHOLD:学习到的停止头的阈值(默认 0.5)。
  • GPU_UTIL:狭窄的可行区间(默认 0.95)。

已知局限性

  • 不透明推理: 由于推理发生在潜空间,输出文本并非内部计算的 token 级记录,这使得过程不可解释。
  • 预热期: 启动后的前一两个请求可能会产生退化重复(例如,“be be be”)。这是一种会自动平复的瞬态状态。
  • 硬件锁定: 模型严格限制于 sm120 (Blackwell) 架构。

社区见解

围绕此次发布的讨论强调了对缺乏与标准 DeepSeek-V4-Flash 模型直接基准对比的担忧,这使得很难量化潜推理提供的确切增益。此外,一些用户指出,与失去可读的思维链相关的潜在对齐风险,因为潜推理使模型的内部逻辑对人类审计员变得不可见。

Sources

相关