LFM2.5-VL-3B DSpark 草稿模型发布,视觉语言推理速度最高提升 3.13 倍
TL;DR
Hugging Face 宣布推出 LFM2.5‑VL‑3B‑DSpark 草稿模型,这是一种推测解码附加组件,可在边缘设备上将视觉语言推理速度提升高达 3.13×,在 H100 GPU 上提升 2.66×,同时仅增加 8.9 % 的总参数量。
什么是 LFM2.5‑VL‑DSpark?
LFM2.5‑VL‑DSpark 是一个实验性的 草稿 模型,与基础视觉语言模型 LFM2.5‑VL‑3B 并列运行。它实现了 推测解码:轻量级草稿模型提出一组候选 token,目标模型随后进行验证。该方法保持了完全一致的输出质量,因为每个 token 最终都由完整模型进行验证。
关键特性:
- 内存影响:增加 280 M 参数(约占 3 B 参数目标的 8.9 %)。
- 速度提升:在 Apple silicon 上 token 解码速度最高提升 3.13×,在 NVIDIA H100 上提升 2.66×,端到端延迟降低 2.62×(设备)和 2.27×(GPU)。
- 开箱即用集成:兼容 llama.cpp、MLX‑VLM 和 SGLang。
视觉语言模型的推测解码原理
草稿模型与仅处理文本的 LFM2.5‑DSpark 草稿模型采用相同架构。它从目标模型的固定层集合中提取隐藏状态,将图像块和文本 token 投影到共享表示空间,并草拟一组 k 个候选 token。
由于投影生成的向量在两种模态中维度相同,推理算法与纯文本情况保持不变。因此,草稿模型仅基于隐藏状态向量运行,无论输入是视觉、文本还是两者的混合。

训练方案与架构细节
- 数据混合:经过精心筛选的视觉语言监督微调(SFT)数据混合,权重偏向预期部署工作负载。
- 层深度:在 3、4 和 5 层上的消融实验表明,4 层仅注意力草稿模型为最优。
- 块大小:训练使用 9 的块大小;推理建议根据硬件选择 8 或 9 的块大小。
- 训练时长:在最终数据混合上训练 10 个 epoch;接受率随更多 token 增加而提升,随后趋于平稳。
参数分解(所有数值单位为百万):
| 组件 | 参数 |
|---|---|
| 解码器堆栈(4 层) | 193.0 |
| 隐藏状态投影 | 21.0 |
| 马尔可夫头 | 65.5 |
| 归一化 + 置信度头 | 0.006 |
| 总计 | 279.5 |
实测推理加速效果
设备端(Apple silicon)
- MLX on M5 Max:解码速度提升 2.30×–3.13×;端到端延迟提升 1.56×–2.62×。
- llama.cpp on M3 Ultra:解码速度提升 1.57×–2.14×;端到端延迟提升 1.30×–1.77×。

GPU(NVIDIA H100)
- 解码加速:2.04×–2.66×。
- 端到端延迟改进:1.64×–2.27×。

所有测量均使用 DSpark 块大小 8,并评估六个 MMSpec 基准任务(通用 VQA、文本 VQA、图像描述、图表 VQA、复杂推理、多轮对话)。
推测解码在视觉工作负载中的局限性
推测解码仅加速 解码 阶段;它 不会 加速图像编码或预填充阶段(即视觉编码器处理图像块的阶段)。在边缘设备上,预填充阶段可能占据大部分运行时间,因此整体延迟提升受限于阿姆达尔定律。因此,即使解码速度大幅提升,当编码或预填充已占用大量运行时间时,端到端性能提升也可能有限。
如何开始使用 LFM2.5‑VL‑DSpark
SGLang
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-VL-3B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
--speculative-draft-attention-backend flashinfer \
--speculative-dspark-block-size 9 \
--disable-radix-cache
通过 http://localhost:30000/v1 查询 OpenAI 兼容端点。
llama.cpp
llama-server -m models/LFM2.5-VL-3B-F16.gguf \
--mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
-md LFM2.5-2.6B-DSpark-F16.gguf \
--spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
-fa on -ngl 99 -c 8192
MLX‑VLM
mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark
三种集成方式均从草稿模型的 config.json 中读取块大小。推测解码为 精确:目标模型验证每个草稿 token,确保输出与单独运行目标模型完全一致。
可用性与许可
草稿模型已在 Hugging Face 上以 Safetensors 和 GGUF 格式提供:
- https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark
- https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark-GGUF
LFM2.5 模型为 开源权重,允许无限制下载、微调和部署。
引用
请按以下方式引用该公告:
Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.
或使用提供的 BibTeX 条目:
@article{liquidAI2026vldspark,
author = {Liquid AI},
title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}