LFM2.5-VL-3B DSpark ドラフトモデルが、エッジデバイスで最大3.13倍の高速な視覚言語推論を実現してリリース

TL;DR

Hugging FaceはLFM2.5‑VL‑3B‑DSparkドロップモデルを発表しました。これは、視覚言語推論をエッジデバイスで最大3.13倍、NVIDIA H100 GPUで最大2.66倍高速化する予測デコード拡張機能であり、パラメータ総数の増加はわずか**8.9 %**にとどまります。


LFM2.5‑VL‑DSparkとは何か?

LFM2.5‑VL‑DSparkは、ベースの視覚言語モデルLFM2.5‑VL‑3Bと併用される実験的なドロップモデルです。このモデルは予測デコードを実装しており、軽量なドロッパーが候補トークンのブロックを提案し、ターゲットモデルがその正当性を検証します。このアプローチにより、最終的にすべてのトークンが完全なモデルによって検証されるため、出力品質は完全に保持されます。

主な特徴:

  • メモリ影響:3Bパラメータのターゲットモデルに対して約8.9 %の増加(280 Mパラメータ)。
  • 速度向上:Apple siliconでは最大3.13倍、NVIDIA H100では最大2.66倍のトークンデコード速度向上。エンドツーエンドのレイテンシはデバイスで最大2.62倍、GPUで最大2.27倍改善。
  • 即日統合:llama.cpp、MLX‑VLM、SGLangと互換性があります。

視覚言語モデルにおける予測デコードの仕組み

ドロッパーは、テキスト専用のLFM2.5‑DSparkドロッパーと同じアーキテクチャを持ちます。ターゲットモデルの固定レイヤーから隠れ状態を取得し、画像パッチとテキストトークンを共通の表現に射影して、k個の候補トークンブロックを生成します。

投影によって両モダリティのベクトルが同じ次元になるため、推論アルゴリズムはテキストの場合と変更されません。したがって、入力が視覚的、文章的、またはその混合であっても、ドロッパーは隠れ状態ベクトルのみを処理します。

DSpark‑Visionアーキテクチャ図


学習手法とアーキテクチャ詳細

  • データミックス:予測される展開ワークロードに重点を置いた、視覚言語の教師あり微調整(SFT)データの選別された混合データ。
  • レイヤー深度:3、4、5レイヤーでのアブレーション実験により、4レイヤーのアテンションのみのドロッパーが最適と判明。
  • ブロックサイズ:学習ではブロックサイズ9を使用。推論ではハードウェアに応じて8または9を推奨。
  • 学習期間:最終データミックスで10エポック。受容率はトークン数の増加とともに向上し、飽和するまで改善。

パラメータ分解(すべて百万単位):

コンポーネント パラメータ数
デコーダースタック(4レイヤー) 193.0
隠れ状態射影 21.0
マルコフヘッド 65.5
ノーマライゼーション + 信頼度ヘッド 0.006
合計 279.5

測定された推論速度向上

デバイス内(Apple silicon)

  • MLX on M5 Max:デコード速度が2.30×–3.13倍高速化。エンドツーエンドレイテンシが1.56×–2.62倍高速化。
  • llama.cpp on M3 Ultra:デコード速度が1.57×–2.14倍高速化。エンドツーエンドレイテンシが1.30×–1.77倍高速化。

デバイス内速度向上スクリーンショット

GPU(NVIDIA H100)

  • デコード速度向上:2.04×–2.66倍。
  • エンドツーエンドレイテンシ改善:1.64×–2.27倍。

GPU速度向上スクリーンショット

すべての測定はブロックサイズ8で実施。6つのMMSpecベンチマークタスク(一般VQA、テキストVQA、画像キャプション、チャートVQA、複雑な推論、マルチターン会話)を評価。


視覚ワークロードにおける予測デコードの限界

予測デコードはデコードフェーズのみを高速化します。画像エンコーディングや、視覚エンコーダーが画像パッチを処理するプレフィルフェーズは高速化されません。エッジデバイスでは、プレフィルフェーズがウォールクロック時間の大部分を占めるため、全体的なレイテンシ向上はアムダールの法則によって制限されます。したがって、エンコーディングやプレフィルがすでに実行時間の大部分を占めている場合、デコード速度の大幅な向上でもエンドツーエンドの改善は限定的になる可能性があります。


LFM2.5‑VL‑3B‑DSparkの使い方

SGLang

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

OpenAI互換エンドポイント http://localhost:30000/v1 にクエリを送信。

llama.cpp

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

MLX‑VLM

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

3つの統合とも、ブロックサイズはドロップモデルのconfig.jsonから読み取ります。予測デコードは正確です:ターゲットモデルがすべてのドロップトークンを検証するため、ターゲットモデル単体で実行した場合と同一の出力を保証します。


利用可能状況とライセンス

ドロップモデルはHugging FaceにSafetensorsおよびGGUF形式でホストされています:

LFM2.5モデルはオープンウェイトであり、無制限のダウンロード、ファインチューニング、デプロイメントが可能です。


引用

以下の通りに発表を引用してください:

Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.

または、以下のBibTeXエントリを使用してください:

@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}

Sources