LFM2.5-VL-3B DSpark 초안 모델, 엣지 디바이스에서 최대 3.13배 빠른 시각-언어 추론으로 공개
TL;DR
Hugging Face는 LFM2.5‑VL‑3B‑DSpark 초안 모델을 발표했습니다. 이는 시각-언어 추론을 엣지 디바이스에서 최대 3.13배, NVIDIA H100 GPU에서는 2.66배 빠르게 하는 사전 추론 추가 기능이며, 전체 파라미터 수는 단지 8.9% 증가에 그칩니다.
LFM2.5‑VL‑DSpark란?
LFM2.5‑VL‑DSpark는 기본 시각-언어 모델인 LFM2.5‑VL‑3B와 함께 작동하는 실험적 초안 모델입니다. 이는 사전 추론(speculative decoding)을 구현합니다: 가벼운 초안 모델이 후보 토큰 블록을 제안하고, 목표 모델이 이를 검증합니다. 이 방법은 모든 토큰이 결국 전체 모델에 의해 검증되기 때문에 정확한 출력 품질을 유지합니다.
주요 특성:
- 메모리 영향: 280M 파라미터 추가 (3B 파라미터 대상의 약 8.9%)
- 속도 향상: Apple silicon에서는 최대 3.13배 빠른 토큰 추론, NVIDIA H100에서는 2.66배 빠르며, 엔드투엔드 지연 시간은 디바이스에서 2.62배, GPU에서 2.27배 감소
- 일일 통합: llama.cpp, MLX‑VLM, SGLang과 호환
시각-언어 모델을 위한 사전 추론의 작동 방식
초안 모델은 텍스트 전용 LFM2.5‑DSpark 초안 모델과 동일한 아키텍처를 사용합니다. 목표 모델의 고정된 레이어 집합에서 숨겨진 상태를 활용하여 이미지 패치와 텍스트 토큰을 공통 표현으로 투영하고, k개의 후보 토큰 블록을 초안합니다.
투영 결과로 생성된 벡터는 두 모달리티 모두 동일한 차원을 가지므로, 추론 알고리즘은 텍스트 경우와 동일하게 유지됩니다. 따라서 초안 모델은 입력이 시각적, 텍스트적, 또는 둘의 조합이든 간에 숨겨진 상태 벡터에만 기반하여 작동합니다.

훈련 레시피 및 아키텍처 세부 사항
- 데이터 혼합: 예상되는 배포 작업 부하에 중점을 둔 시각-언어 감독형 미세조정(SFT) 데이터의 정교한 혼합
- 레이어 깊이: 3, 4, 5 레이어에서의 실험 결과, 4레이어의 어텐션 전용 초안 모델이 최적임을 확인
- 블록 크기: 훈련 시 9의 블록 크기를 사용했으며, 하드웨어에 따라 추론 시 8 또는 9를 권장
- 훈련 기간: 최종 데이터 혼합으로 10 에포크; 수용률은 더 많은 토큰을 처리할수록 향상되나, 포화 상태에 도달함
파라미터 분해 (모든 수치는 백만 단위):
| 구성 요소 | 파라미터 |
|---|---|
| 디코더 스택 (4층) | 193.0 |
| 숨겨진 상태 투영 | 21.0 |
| 마르코프 헤드 | 65.5 |
| 정규화 + 신뢰도 헤드 | 0.006 |
| 총계 | 279.5 |
측정된 추론 속도 향상
디바이스 내 (Apple silicon)
- MLX on M5 Max: 추론 속도 2.30×–3.13× 빠름; 엔드투엔드 지연 시간 1.56×–2.62× 빠름
- llama.cpp on M3 Ultra: 추론 속도 1.57×–2.14× 빠름; 엔드투엔드 지연 시간 1.30×–1.77× 빠름

GPU (NVIDIA H100)
- 추론 속도 향상: 2.04×–2.66×
- 엔드투엔드 지연 시간 개선: 1.64×–2.27×

모든 측정은 DSpark 블록 크기 8을 사용하고, 여섯 가지 MMSpec 벤치마크 작업(일반 VQA, 텍스트 VQA, 이미지 캡션, 차트 VQA, 복잡한 추론, 다중턴 대화)을 평가합니다.
시각 작업에 대한 사전 추론의 한계
사전 추론은 추론(decode) 단계만 가속화하며, 이미지 인코딩이나 시각 인코더가 이미지 패치를 처리하는 프리필(prefill) 단계는 가속화하지 않습니다. 엣지 디바이스에서는 프리필이 실제 시간의 대부분을 차지할 수 있으므로, 전체 지연 시간 향상은 아문달의 법칙에 의해 제한됩니다. 따라서 인코딩이나 프리필이 이미 실행 시간의 상당 부분을 차지하는 경우, 큰 추론 속도 향상이라도 엔드투엔드 개선은 제한적일 수 있습니다.
LFM2.5‑VL‑DSpark 사용 시작하기
SGLang
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-VL-3B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
--speculative-draft-attention-backend flashinfer \
--speculative-dspark-block-size 9 \
--disable-radix-cache
OpenAI 호환 엔드포인트 http://localhost:30000/v1에서 쿼리합니다.
llama.cpp
llama-server -m models/LFM2.5-VL-3B-F16.gguf \
--mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
-md LFM2.5-2.6B-DSpark-F16.gguf \
--spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
-fa on -ngl 99 -c 8192
MLX‑VLM
mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark
세 가지 통합 모두 초안 모델의 config.json에서 블록 크기를 읽습니다. 사전 추론은 정확한 것으로, 목표 모델이 모든 초안 토큰을 검증하므로, 목표 모델만 실행했을 때와 동일한 출력을 보장합니다.
사용 가능 및 라이선스
초안 모델은 Hugging Face에 Safetensors 및 GGUF 형식으로 호스팅되어 있습니다:
- https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark
- https://huggingface.co/LiquidAI/LFM2.5-VL-3B-DSpark-GGUF
LFM2.5 모델은 오픈웨이트(open-weight)로, 제한 없이 다운로드, 미세조정, 배포가 가능합니다.
인용
다음과 같이 발표를 인용해 주세요:
Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.
또는 제공된 BibTeX 항목을 사용하세요:
@article{liquidAI2026vldspark,
author = {Liquid AI},
title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}