SmolVLM2: 让每台设备都能理解视频

Hugging Face 推出了 SmolVLM2,这是一系列高效的多模态模型,旨在将视频和图像理解带到本地设备。通过发布三种规模的模型——2.2B、500M 和 256M 参数——SmolVLM2 使得从手机到服务器的硬件都能在不需要巨大计算资源的情况下进行高性能的视觉分析。

模型变体和性能

SmolVLM2 提供三种不同的模型规模,以在性能和内存消耗之间取得平衡,其中 500M 和 256M 版本代表目前发布的最小视频语言模型。

SmolVLM2 2.2B

2.2B 模型是通用视觉和视频任务的主要选择。它在以下几个关键领域相较于之前的 SmolVLM 系列展示了显著提升:

  • 数学推理: 增强了使用图像解决数学问题的能力。
  • OCR 和图表: 改善了照片中的文本阅读以及对复杂图表的理解。
  • 科学问答: 在科学视觉问题上的表现更好。

在 Video-MME 基准测试中,2.2B 模型在 2B 参数范围内优于所有现有模型。其内存效率使其能够在 Google Colab 的免费层级上运行。

SmolVLM2 500M 和 256M

500M 模型在参数量不到 2.2B 模型四分之一的情况下,提供了与 2.2B 模型非常接近的视频理解能力。256M 模型是一个实验性发布,旨在探索能够处理视频的最小模型的边界,作为专业微调和创意应用的基础。

实际应用和演示

为了展示小规模视频模型的实用性,Hugging Face 开发了三个具体的应用:

  • iPhone 视频理解: 使用 500M 模型的本地应用,可在设备上直接分析视频内容,无需云连接。
  • VLC 媒体播放器集成: 与 VLC 合作,实现视频内的语义搜索和导航,使用户能够根据自然语言描述跳转到特定章节。
  • 视频亮点生成器: 能够处理长格式视频(超过一小时),例如足球比赛,以自动提取最重要时刻的工具。

技术实现与部署

SmolVLM2 与 transformers 库和用于 Apple Silicon 优化的 MLX 集成,从发布起即如此。

Transformers 集成

推理通过使用聊天模板的对话式 API 进行处理。模型支持:

  • 视频推理: 通过传递路径 `{

Sources