LFM2.5-VL-3B DSpark 草稿模型发布,视觉语言推理速度最高提升 3.13 倍

TL;DR

Hugging Face 宣布推出 LFM2.5‑VL‑3B‑DSpark 草稿模型,这是一种推测解码附加组件,可在边缘设备上将视觉语言推理速度提升高达 3.13×,在 H100 GPU 上提升 2.66×,同时仅增加 8.9 % 的总参数量。


什么是 LFM2.5‑VL‑DSpark?

LFM2.5‑VL‑DSpark 是一个实验性的 草稿 模型,与基础视觉语言模型 LFM2.5‑VL‑3B 并列运行。它实现了 推测解码:轻量级草稿模型提出一组候选 token,目标模型随后进行验证。该方法保持了完全一致的输出质量,因为每个 token 最终都由完整模型进行验证。

关键特性:

  • 内存影响:增加 280 M 参数(约占 3 B 参数目标的 8.9 %)。
  • 速度提升:在 Apple silicon 上 token 解码速度最高提升 3.13×,在 NVIDIA H100 上提升 2.66×,端到端延迟降低 2.62×(设备)和 2.27×(GPU)。
  • 开箱即用集成:兼容 llama.cpp、MLX‑VLM 和 SGLang。

视觉语言模型的推测解码原理

草稿模型与仅处理文本的 LFM2.5‑DSpark 草稿模型采用相同架构。它从目标模型的固定层集合中提取隐藏状态,将图像块和文本 token 投影到共享表示空间,并草拟一组 k 个候选 token。

由于投影生成的向量在两种模态中维度相同,推理算法与纯文本情况保持不变。因此,草稿模型仅基于隐藏状态向量运行,无论输入是视觉、文本还是两者的混合。

DSpark‑Vision 架构图


训练方案与架构细节

  • 数据混合:经过精心筛选的视觉语言监督微调(SFT)数据混合,权重偏向预期部署工作负载。
  • 层深度:在 3、4 和 5 层上的消融实验表明,4 层仅注意力草稿模型为最优。
  • 块大小:训练使用 9 的块大小;推理建议根据硬件选择 8 或 9 的块大小。
  • 训练时长:在最终数据混合上训练 10 个 epoch;接受率随更多 token 增加而提升,随后趋于平稳。

参数分解(所有数值单位为百万):

组件 参数
解码器堆栈(4 层) 193.0
隐藏状态投影 21.0
马尔可夫头 65.5
归一化 + 置信度头 0.006
总计 279.5

实测推理加速效果

设备端(Apple silicon)

  • MLX on M5 Max:解码速度提升 2.30×–3.13×;端到端延迟提升 1.56×–2.62×。
  • llama.cpp on M3 Ultra:解码速度提升 1.57×–2.14×;端到端延迟提升 1.30×–1.77×。

设备端加速截图

GPU(NVIDIA H100)

  • 解码加速:2.04×–2.66×。
  • 端到端延迟改进:1.64×–2.27×。

GPU 加速截图

所有测量均使用 DSpark 块大小 8,并评估六个 MMSpec 基准任务(通用 VQA、文本 VQA、图像描述、图表 VQA、复杂推理、多轮对话)。


推测解码在视觉工作负载中的局限性

推测解码仅加速 解码 阶段;它 不会 加速图像编码或预填充阶段(即视觉编码器处理图像块的阶段)。在边缘设备上,预填充阶段可能占据大部分运行时间,因此整体延迟提升受限于阿姆达尔定律。因此,即使解码速度大幅提升,当编码或预填充已占用大量运行时间时,端到端性能提升也可能有限。


如何开始使用 LFM2.5‑VL‑DSpark

SGLang

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

通过 http://localhost:30000/v1 查询 OpenAI 兼容端点。

llama.cpp

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

MLX‑VLM

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

三种集成方式均从草稿模型的 config.json 中读取块大小。推测解码为 精确:目标模型验证每个草稿 token,确保输出与单独运行目标模型完全一致。


可用性与许可

草稿模型已在 Hugging Face 上以 Safetensors 和 GGUF 格式提供:

LFM2.5 模型为 开源权重,允许无限制下载、微调和部署。


引用

请按以下方式引用该公告:

Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.

或使用提供的 BibTeX 条目:

@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}

Sources