Hugging Face 视觉语言模型 2025 更新

视觉语言模型(VLM)已经从简单的图像到文本系统演进为能够进行复杂推理、任意模态间生成以及与物理世界交互的多模态代理。当前的格局呈现出向更小、更高效模型转变、Mixture‑of‑Experts(MoE)解码器的集成,以及多模态检索增强生成(RAG)和机器人控制等专用能力的兴起。

新兴模型架构与趋势

近期的 VLM 发展引入了若干全新的架构范式,扩展了多模态 AI 的应用范围。

任意到任意模型

任意到任意模型能够处理任何输入模态(图像、文本、音频),并生成任意输出模态。这类模型使用多个编码器将嵌入融合到共享的表示空间,然后解码为所需的模态。值得关注的例子包括:

  • Qwen 2.5 Omni:采用 “Thinker‑Talker” 架构,其中 “Thinker” 负责文本处理, “Talker” 负责流式自然语音输出。
  • MiniCPM-o 2.6:一款 8B 参数模型,能够理解并生成视觉、语音和语言内容。
  • Janus-Pro-7B:采用解耦的视觉编码架构,将理解过程与生成过程分离。
  • Chameleon (Meta):早期的任意到任意能力尝试,后被 Alpha‑VLLM 的 Lumina-mGPT 扩展以支持图像生成。

多模态推理模型

推理模型旨在通过长链式思考(chain‑of‑thought)处理来解决复杂问题。Kimi-VL-A3B-Thinking 是典型代表,使用 MoonViT 图像编码器和 Mixture‑of‑Experts(MoE)解码器(总计 16B 参数,活跃 2.8B)。它是对 Kimi-VL 基础模型进行长链式思考微调并通过强化学习对齐的版本。

小型高效 VLM

“Smol” 模型(通常小于 2B 参数)正成为趋势,以降低计算成本并实现本地运行在消费设备上。

  • SmolVLM2:专注于视频理解,提供 256M、500M 和 2.2B 参数规模。
  • Gemma 3-4B-it:是最小的多模态模型之一,拥有 128k token 上下文窗口,支持 140 多种语言。
  • Qwen2.5-VL-3B-Instruct:具备本地化、文档理解和代理任务能力,支持 32k token 上下文长度。

Mixture‑of‑Experts(MoE)解码器

MoE 架构用路由器取代传统的前馈网络(FFN)层,仅激活最相关的 “专家”。相比密集模型,这可实现更快的推理和更快的训练收敛,代价是需要更多 GPU 显存。示例包括 Kimi-VLMoE‑LLaVADeepSeek-VL2Llama 4

视觉‑语言‑动作(VLA)模型

VLA 在 VLM 基础上加入动作和状态 token,使模型能够控制物理环境或数字 UI。

  • π0 and π0-FAST:在 7 个平台、68 项任务(如折叠衣物、物体检索)上训练的机器人基础模型。
  • GR00T N1 (NVIDIA):一款 2B 基础模型,面向类人机器人,将图像和语言转换为实时运动控制。

专用多模态能力

本地化:检测、分割与计数

VLM 现在通过输出带有本地化 token 的结构化文本来概括传统计算机视觉任务。

  • PaliGemma and PaliGemma 2:使用任务前缀(如 “segment striped cat”)输出边界框坐标或用于分割掩码的码本索引。
  • Molmo:能够用点标记指向实例并计数对象。
  • Qwen2.5-VL:支持检测、指向和计数,包括 UI 元素。

多模态安全模型

为防止 jailbreak 和有害输出,多模态安全模型会过滤输入和输出。

  • ShieldGemma 2:开源安全模型,根据特定内容政策评估图像。
  • Llama Guard 4:从 Llama 4 Scout 剪枝得到的密集多模态、多语言安全模型。

多模态检索增强生成(RAG)

多模态 RAG 通过多模态检索器直接从截图中定位相关页面,绕过脆弱的 PDF 解析。

  • Document Screenshot Embedding (DSE):使用文本和图像编码器为每段返回单一向量。
  • 类似 ColBERT 的模型(如 ColPali、ColQwen2):将 VLM 作为图像编码器,LLM 作为文本编码器,利用 “MaxSim” 计算文本 token 与图像 patch 之间的相似度,以获得更高精度。

多模态代理与视频理解

GUI 与数字代理

VLM 正日益用于电脑和手机操作。UI‑TARS‑1.5(ByteDance)和 MAGMA‑8B 旨在实现 UI 导航和物理交互。Hugging Face 的 smolagents 库现已支持 VLM 集成,允许代理在接收初始图像或通过回调动态获取截图,以实现实时 GUI 控制。

视频语言模型

视频理解通过将视频视为帧序列来处理,并采用多种策略管理时间关系:

  • LongVU (Meta):使用 DINOv2 对帧进行下采样,去除相似帧,并根据文本查询对帧集进行精炼。
  • Qwen2.5-VL:利用扩展的多模态 RoPE 理解绝对时间位置并处理动态 FPS 速率。
  • Gemma 3:在文本提示中接受交错的时间戳视频帧。

对齐与评估

偏好优化

直接偏好优化(DPO)已被用于 VLM,以通过 “chosen” 与 “rejected” 答案对将模型响应对齐至人类偏好。RLAIF‑V 数据集提供超过 83,000 条标注样本,trl 库提供 DPOTrainer 用于实现该工作流。

高级基准

随着模型在旧基准上趋于饱和,出现了评估专家级知识与推理的新工具:

  • MMT‑Bench:包含 31,325 道多选题,覆盖 32 项元任务(OCR、视觉识别等),使用图像、文本、视频和点云模态。
  • MMMU‑Pro:在 MMMU 基础上演进,将候选选项从 4 增至 10,并加入仅视觉输入和真实世界仿真,以模拟实际显示条件。

Sources