LFM2.5-VL-3B DSpark 草稿模型釋出,視覺-語言推理速度最高提升 3.13 倍

TL;DR

Hugging Face 宣布推出 LFM2.5‑VL‑3B‑DSpark 草稿模型,這是一款 speculative decoding 增強模組,可在邊緣裝置上將視覺-語言推理速度提升最多 3.13×,在 H100 GPU 上提升 2.66×,同時僅增加 8.9 % 的總參數量。


什麼是 LFM2.5‑VL‑DSpark?

LFM2.5‑VL‑DSpark 是一款實驗性 草稿 模型,與基礎視覺-語言模型 LFM2.5‑VL‑3B 搭配使用。它實現了 speculative decoding:輕量級草稿模型會提出一組候選 token,再由目標模型進行驗證。此方法能保持完全相同的輸出品質,因為每個 token 最終都由完整模型驗證過。

主要特性:

  • 記憶體影響:增加 280 M 參數(約為 3 B 參數目標的 8.9 %)。
  • 速度提升:在 Apple silicon 上 token 解碼速度最快提升 3.13×,在 NVIDIA H100 上提升 2.66×,端到端延遲分別降低 2.62×(裝置)與 2.27×(GPU)。
  • 即時整合:相容於 llama.cpp、MLX‑VLM 與 SGLang。

視覺-語言模型的 speculative decoding 如何運作

草稿模型採用與純文字 LFM2.5‑DSpark 草稿模型相同的架構。它從目標模型的固定層集合中提取隱藏狀態,將影像區塊與文字 token 投影至共享表示空間,並草擬一組 k 個候選 token。

由於投影產生的向量在兩個模態中維度相同,因此推理演算法與純文字情況無異。因此,草稿模型僅操作於隱藏狀態向量,無論輸入是視覺、文字或兩者混合。

DSpark‑Vision 架構圖


訓練配方與架構細節

  • 資料混合:經過精心挑選的視覺-語言監督微調(SFT)資料混合,權重偏向預期部署工作負載。
  • 層深度:在 3、4、5 層的消融實驗中,發現 4 層僅注意力草稿模型 為最佳。
  • 區塊大小:訓練使用區塊大小為 9;根據硬體建議推理時使用區塊大小 8 或 9。
  • 訓練時長:在最終資料混合上訓練 10 個 epoch;接受率隨著更多 token 而提升,最終趨於穩定。

參數細分(所有數字單位為百萬):

元件 參數
解碼器堆疊(4 層) 193.0
隱藏狀態投影 21.0
馬可夫頭 65.5
正規化 + 語氣頭 0.006
總計 279.5

測量的推理加速效果

裝置上(Apple silicon)

  • MLX on M5 Max:解碼速度提升 2.30×–3.13×;端到端延遲提升 1.56×–2.62×。
  • llama.cpp on M3 Ultra:解碼速度提升 1.57×–2.14×;端到端延遲提升 1.30×–1.77×。

裝置上加速效果截圖

GPU(NVIDIA H100)

  • 解碼加速:2.04×–2.66×。
  • 端到端延遲改善:1.64×–2.27×。

GPU 加速效果截圖

所有測量均使用 DSpark 區塊大小 8,並評估六項 MMSpec 基準任務(一般 VQA、文字 VQA、影像說明、圖表 VQA、複雜推理、多輪對話)。


speculative decoding 在視覺工作負載上的限制

speculative decoding 僅加速 解碼 階段;它 不會 加速影像編碼或預填入階段(vision encoder 處理影像區塊的階段)。在邊緣裝置上,預填入階段可能佔據大部分的時鐘時間,因此整體延遲提升受到 Amdahl’s law 的限制。因此,即使解碼速度大幅提升,若編碼或預填入已佔用大量執行時間,端到端的改善仍可能有限。


如何開始使用 LFM2.5‑VL‑DSpark

SGLang

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

於 http://localhost:30000/v1 查詢 OpenAI 兼容端點。

llama.cpp

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

MLX‑VLM

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

三種整合方式皆會從草稿模型的 config.json 讀取區塊大小。speculative decoding 是 精確的:目標模型會驗證每個草稿 token,確保輸出與單獨運行目標模型完全相同。


可用性與授權

草稿模型已上傳至 Hugging Face,提供 Safetensors 與 GGUF 格式:

LFM2.5 模型為 開放權重,允許自由下載、微調與部署。


引用

請以以下方式引用此公告:

Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.

或使用提供的 BibTeX 條目:

@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}

Sources