Hugging Face 视觉语言模型 2025 更新
视觉语言模型(VLM)已经从简单的图像到文本系统演进为能够进行复杂推理、任意模态间生成以及与物理世界交互的多模态代理。当前的格局呈现出向更小、更高效模型转变、Mixture‑of‑Experts(MoE)解码器的集成,以及多模态检索增强生成(RAG)和机器人控制等专用能力的兴起。
新兴模型架构与趋势
近期的 VLM 发展引入了若干全新的架构范式,扩展了多模态 AI 的应用范围。
任意到任意模型
任意到任意模型能够处理任何输入模态(图像、文本、音频),并生成任意输出模态。这类模型使用多个编码器将嵌入融合到共享的表示空间,然后解码为所需的模态。值得关注的例子包括:
- Qwen 2.5 Omni:采用 “Thinker‑Talker” 架构,其中 “Thinker” 负责文本处理, “Talker” 负责流式自然语音输出。
- MiniCPM-o 2.6:一款 8B 参数模型,能够理解并生成视觉、语音和语言内容。
- Janus-Pro-7B:采用解耦的视觉编码架构,将理解过程与生成过程分离。
- Chameleon (Meta):早期的任意到任意能力尝试,后被 Alpha‑VLLM 的 Lumina-mGPT 扩展以支持图像生成。
多模态推理模型
推理模型旨在通过长链式思考(chain‑of‑thought)处理来解决复杂问题。Kimi-VL-A3B-Thinking 是典型代表,使用 MoonViT 图像编码器和 Mixture‑of‑Experts(MoE)解码器(总计 16B 参数,活跃 2.8B)。它是对 Kimi-VL 基础模型进行长链式思考微调并通过强化学习对齐的版本。
小型高效 VLM
“Smol” 模型(通常小于 2B 参数)正成为趋势,以降低计算成本并实现本地运行在消费设备上。
- SmolVLM2:专注于视频理解,提供 256M、500M 和 2.2B 参数规模。
- Gemma 3-4B-it:是最小的多模态模型之一,拥有 128k token 上下文窗口,支持 140 多种语言。
- Qwen2.5-VL-3B-Instruct:具备本地化、文档理解和代理任务能力,支持 32k token 上下文长度。
Mixture‑of‑Experts(MoE)解码器
MoE 架构用路由器取代传统的前馈网络(FFN)层,仅激活最相关的 “专家”。相比密集模型,这可实现更快的推理和更快的训练收敛,代价是需要更多 GPU 显存。示例包括 Kimi-VL、MoE‑LLaVA、DeepSeek-VL2 和 Llama 4。
视觉‑语言‑动作(VLA)模型
VLA 在 VLM 基础上加入动作和状态 token,使模型能够控制物理环境或数字 UI。
- π0 and π0-FAST:在 7 个平台、68 项任务(如折叠衣物、物体检索)上训练的机器人基础模型。
- GR00T N1 (NVIDIA):一款 2B 基础模型,面向类人机器人,将图像和语言转换为实时运动控制。
专用多模态能力
本地化:检测、分割与计数
VLM 现在通过输出带有本地化 token 的结构化文本来概括传统计算机视觉任务。
- PaliGemma and PaliGemma 2:使用任务前缀(如 “segment striped cat”)输出边界框坐标或用于分割掩码的码本索引。
- Molmo:能够用点标记指向实例并计数对象。
- Qwen2.5-VL:支持检测、指向和计数,包括 UI 元素。
多模态安全模型
为防止 jailbreak 和有害输出,多模态安全模型会过滤输入和输出。
- ShieldGemma 2:开源安全模型,根据特定内容政策评估图像。
- Llama Guard 4:从 Llama 4 Scout 剪枝得到的密集多模态、多语言安全模型。
多模态检索增强生成(RAG)
多模态 RAG 通过多模态检索器直接从截图中定位相关页面,绕过脆弱的 PDF 解析。
- Document Screenshot Embedding (DSE):使用文本和图像编码器为每段返回单一向量。
- 类似 ColBERT 的模型(如 ColPali、ColQwen2):将 VLM 作为图像编码器,LLM 作为文本编码器,利用 “MaxSim” 计算文本 token 与图像 patch 之间的相似度,以获得更高精度。
多模态代理与视频理解
GUI 与数字代理
VLM 正日益用于电脑和手机操作。UI‑TARS‑1.5(ByteDance)和 MAGMA‑8B 旨在实现 UI 导航和物理交互。Hugging Face 的 smolagents 库现已支持 VLM 集成,允许代理在接收初始图像或通过回调动态获取截图,以实现实时 GUI 控制。
视频语言模型
视频理解通过将视频视为帧序列来处理,并采用多种策略管理时间关系:
- LongVU (Meta):使用 DINOv2 对帧进行下采样,去除相似帧,并根据文本查询对帧集进行精炼。
- Qwen2.5-VL:利用扩展的多模态 RoPE 理解绝对时间位置并处理动态 FPS 速率。
- Gemma 3:在文本提示中接受交错的时间戳视频帧。
对齐与评估
偏好优化
直接偏好优化(DPO)已被用于 VLM,以通过 “chosen” 与 “rejected” 答案对将模型响应对齐至人类偏好。RLAIF‑V 数据集提供超过 83,000 条标注样本,trl 库提供 DPOTrainer 用于实现该工作流。
高级基准
随着模型在旧基准上趋于饱和,出现了评估专家级知识与推理的新工具:
- MMT‑Bench:包含 31,325 道多选题,覆盖 32 项元任务(OCR、视觉识别等),使用图像、文本、视频和点云模态。
- MMMU‑Pro:在 MMMU 基础上演进,将候选选项从 4 增至 10,并加入仅视觉输入和真实世界仿真,以模拟实际显示条件。