LFM2.5-VL-3B 릴리스 노트 / 새로운 기능
Liquid AI는 고성능 온디바이스 및 에지 배포를 위해 설계된 시각-언어 모델(VLM)인 LFM2.5-VL-3B를 발표했습니다. 이 모델은 실시간 애플리케이션에 최적화되어 있으며, 낮은 지연 시간을 유지하기 위해 사고의 사슬(chain-of-thought) 추론보다는 직접적인 답변을 우선시합니다.
주요 기능 및 개선 사항
LFM2.5-VL-3B는 이전 버전 대비 네 가지 주요 개선 사항을 도입했습니다:
- 화면 및 UI 이해: 다양한 장치의 디지털 화면을 해석하는 능력이 향상되었습니다.
- 그라운딩(Grounding): 자연어 쿼리를 사용한 객체 탐지 및 그라운딩 능력이 개선되었습니다.
- 멀티 이미지 입력: 여러 이미지를 동시에 처리할 때 더 나은 추론 능력을 제공합니다.
- 함수 호출(Function Calling): 텍스트 전용 및 시각-텍스트 시나리오 모두에서 도구 사용 및 함수 호출 기능이 크게 향상되었습니다.
기술 아키텍처 및 학습
LFM2.5-VL-3B는 3.1B 파라미터 모델로, SigLIP2 400M NaFlex 비전 인코더와 LFM2.5-2.6B 텍스트 모델에서 사용된 사전 학습된 백본을 결합합니다.
학습 데이터 및 프로세스
- 사전 학습(Pre-training): 모델은 약 34조 개의 토큰으로 사전 학습되었습니다. 여기에는 이미지 캡셔닝, OCR, 그라운딩 및 지시 사항 준수(instruction-following)를 위해 큐레이션된 합성 데이터 세트를 활용하여 이전 버전보다 4배 더 많은 비전 데이터가 포함되었습니다.
- 토크나이저(Tokenizer): 비라틴 문자 스크립트를 지원하기 위해, in-place tokenizer extension을 사용하여 어휘집(vocabulary)을 128K로 확장했습니다.
- 사후 학습(Post-training): 학습 파이프라인은 두 단계로 구성됩니다: 더 큰 교사 모델로부터의 지식 증류(knowledge distillation)와 Antidoom 학습을 활용한 지도 미세 조정(SFT), 그 다음 다중 보상 강화 학습(RL)이 이어집니다.
성능 벤치마크
비전 성능
LFM2.5-VL-3B는 실제 이미지 작업에서 해당 크기 클래스의 모델을 선도하며, 차트 및 UI 요소를 포함한 디지털 콘텐츠를 읽는 데 강력한 성능을력을 보여줍니다. 비교 테스트(정규화 0-100)에서 비전 벤치마크 전반에 걸쳐 평균 69.4점을 기록하여 InternVL 3.5 4B (69.4) 및 Qwen3.5-4B (70.1)와 긴밀하게 경쟁합니다.
주요 벤치마크 결과는 다음과 같습니다:
- ScreenSpot-v2 (Desktop/Mobile/Web): LFM2-VL-3B 대비 성능이 크게 향상되었으며, 점수는 78.7 (Desktop), 81.2 (Mobile), 82.2 (Web)입니다.
- RefCOCO-avg (Grounding): 87.9점을 기록하여 이전 버전의 57.1점으로부터 상당한 증가를 보였습니다.
- BLINK (Multi-Image): 61.5점을 기록하여 Gemma-4-E4B-it (52.2) 및 Qwen3.5-2B (48.6)와 같은 여러 더 큰 모델을 능가했습니다.
텍스트 및 도구 사용 성능
텍스트 전용 벤치마크에서 LFM2.5-VL-3B는 개선된 지시 사항 준수(IFEval: 82.3)와 도구 사용 능력의 급격한 증가를 보여주었습니다. ToolSandbox (59.5)에서, Gemma-4-E2B (56.5) 및 Qwen3.5-2B (47.7)와 대등한 성능을를 보여줍니다.
추론 속도 및 하드웨어 호환성
LFM2.5-VL-3B는 에지 장치용으로 설계되어 약 3 GB의 메모리에 적합합니다. llama.cpp, MLX, vLLM, SGLang, 및 ONNX에 대한 출시 당일 지원을 제공합니다.
온디바이스 벤치마크
- M5 Max: 228 tokens/s
- Ryzen AI Max+ 395: 116 tokens/s
- Galaxy S26 Ultra: 20 tokens/s
GPU 처리량
H100 GPU에서, 모델은 높은 동시성에서 초당 약 11K 토큰의 출력 처리량을 달성합니다. 이는 4B-클래스 모델 처리량의 약 두 배에 해당합니다. 이를 통해 단일 H100에서 하루에 거의 10억 개의 출력 토큰을 생성할 수 있습니다.
구현
LFM2.5-VL-3B는 Hugging Face에서 사용할 수 있으며 transformers>=5.10.1와 호환됩니다. 이미지 설명, 그라운딩, 및 OCR 작업을 위해 AutoModelForImageTextToText 및 AutoProcessor를 사용하여 로드할 수 있습니다 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch