SmolVLM 256M 和 500M 发布说明

Hugging Face 发布了 SmolVLM-256MSmolVLM-500M,这是两款新的轻量级视觉语言模型(VLM),专为受限设备、消费者笔记本和基于浏览器的推理而设计。256M 模型目前是世界上最小的 VLM,但其性能却超过了 17 个月前发布的 Idefics 80B 模型。

模型变体和功能

提供两种模型规格,每种规格均提供基础模型和指令微调版本:

  • SmolVLM-256M:目前可用的最小 VLM,能够进行图像和短视额生成、文本(PDF 和扫描文本),以及涉及图表和图形的基本视觉推理。
  • SmolVLM-500M:一个五亿参数模型(半十亿),提供更生成、文档问答(PDF 和扫描文本),以及涉及图表和图形的基本视觉推理。
  • SmolVLM-500M:一个十亿参数的模型(半十亿),提供更高的性能空间和对提示的更强鲁棒性,使其更适合开箱即用的生产使用。它在 MMMU 和 DocVQA 上的性能接近更大的模型。

相较于 SmolVLM 2B 的技术改进

Hugging Face 实施了多种设计权衡和优化,以在保持多模态性能的同时减少模型占用:

视觉编码器优化

这些模型不使用 SmolVLM 2B 中的 SigLIP 400M SO 编码器,而是采用 SigLIP base patch-16/512(93M 参数)。测试表明,更大的编码器仅带来微小的性能提升。更小的编码器还能以更高的分辨率处理图像,在几乎没有额外开销的情况下提升视觉理解能力。

数据混合更新

训练数据来源于 The Cauldron 和 Docmatix,并加入了 MathWriting。数据比例已调整以强调:

  • 文档理解:41%
  • 图像字幕:14%

分词增强

为了提高效率,这些模型现在以 4096 像素/token 的速度编码图像,而 2B 版本为 1820 像素/token。此外,引入了特殊标记来替换多标记字符串的子图像分隔符(例如,将 <row_1_col_1><row_6_col_6> 映射到单个标记),这提高了训练稳定性和结果质量。

生态系统与集成

使用 ColSmolVLM 进行多模态检索

团队使用类似 ColBERT 的检索架构开发了 ColSmolVLM 256M 和 500M。这些模型提供了最先进的多模态检索速度,其性能可与大小为其 10 倍的模型相媲美,从而降低了构建可搜索数据库所需的成本和时间。

使用 SmolDocling 进行文档处理

在与 IBM 的合作中,Hugging Face 正将这些模型集成到 Docling 中。早期结果表明,256M 模型在文档布局和表格理解方面非常有效。

部署与框架支持

SmolVLM-256M 和 500M 与现有的 SmolVLM 代码兼容,并支持以下框架:

  • Transformers:直接加载用于推理和微调。
  • MLX:针对 Apple Silicon 进行了优化。
  • ONNX:提供了用于 WebGPU 演示和基于浏览器推理的检查点。
  • TRL:支持对齐和直接偏好优化(DPO)。

Sources