LFM2.5-VL-3B 发布说明 / 更新内容

Liquid AI 发布了 LFM2.5-VL-3B,这是一款专为高性能端侧和边缘部署设计的视觉语言模型 (VLM)。该模型针对实时应用进行了优化,优先考虑直接回答而非思维链推理,以保持低延迟。

关键能力与改进

LFM2.5-VL-3B 相比之前的版本引入了四项主要增强功能:

  • 屏幕与 UI 理解: 增强了对各种设备上数字屏幕的解释能力。
  • Grounding(定位): 改进了使用自然语言查询进行的目标检测和定位能力。
  • 多图输入: 在同时处理多张图像时具有更好的推理能力。
  • Function Calling(函数调用): 在纯文本和视觉-文本场景下,对工具使用和函数调用的能力都有显著提升。

技术架构与训练

LFM2.5-VL-3B 是一个 3.1B 参数的模型,它将 SigLIP2 400M NaFlex 视觉编码器与 LFM2.5-2.6B 文本模型中使用的预训练骨干网络相结合。

训练数据与流程

  • 预训练: 该模型在约 34 万亿个 token 上进行了预训练。这包括比之前版本多四倍的视觉数据,利用了经过策划和合成的数据集进行图像描述、OCR、grounding 和指令遵循。
  • Tokenizer(分词器): 为了支持非拉丁语系,通过原位分词器扩展技术将词表扩展到了 128K。
  • 训练后处理: 训练流水线包含两个阶段:利用从更大教师模型进行知识蒸馏的监督微调 (SFT) 和 Antidoom 训练,随后是多奖励强化学习 (RL)。

性能基准测试

视觉性能

LFM2.5-VL-3B 在现实世界的图像任务上处于其同规模级别中的领先地位,并在阅读数字内容(包括图表和 UI 元素)方面表现出强大的性能。在对比测试(归一化 0-100)中,它在视觉基准测试中获得了 69.4 的平均分,与 InternVL 3.5 4B (69.4) 和 Qwen3.5-4B (70.1) 竞争激烈。

值得注意的基准测试结果包括:

  • ScreenSpot-v2 (Desktop/Mobile/Web): 相比 LFM2-VL-3B 有显著提升,得分分别为 78.7 (Desktop)、81.2 (Mobile) 和 82.2 (Web)。
  • RefCOCO-avg (Grounding): 得分为 87.9,较之前版本的 57.1 大幅增加。
  • BLINK (Multi-Image): 得分为 61.5,优于 Gemma-4-E4B-it (52.2) 和 Qwen3.5-2B (48.6) 等多个更大规模的模型。

文本与工具使用性能

在纯文本基准测试中,LFM2.5-VL-3B 展示了改进的指令遵循能力 (IFEval: 82.3) 以及工具使用能力的显著提升。在 ToolSandbox (59.5) 中,其表现与 Gemma-4-E2B (56.5) 和 Qwen3.5-2B (47.7) 相当。

推理速度与硬件兼容性

LFM2.5-VL-3B 专为边缘端设计,占用内存约为 3 GB。它提供对 llama.cpp, MLX, vLLM, SGLang, 和 ONNX 的首日支持。

端侧基准测试

  • M5 Max: 228 tokens/s
  • Ryzen AI Max+ 395: 116 tokens/s
  • Galaxy S26 Ultra: 20 tokens/s

GPU 吞吐量

在 H100 GPU 上,该模型在高并发情况下可达到约 11K tokens/s 的输出吞吐量,约为 4B 级模型的两倍。这使得单台 H100 每天可以产生近 10 亿个输出 token。

实现方式

LFM2.5-VL-3B 已在 Hugging Face 上发布,并兼容 transformers>=5.10.1。对于涉及图像描述、grounding 和 OCR 的任务,可以使用 AutoModelForImageTextToTextAutoProcessor 进行加载。

Sources

相关