Qwen2.5-VL 发布说明

Qwen 已宣布发布 Qwen2.5-VL,这是一个旗舰视觉语言模型,相较于 Qwen2-VL 取得了显著进步。该模型提供三种规模——3B、7B 和 72B——基础版和指令版均通过 Hugging Face 和 ModelScope 提供。

关键能力和特性

Qwen2.5-VL 引入了多项专为复杂视觉推理和代理行为设计的高级能力:

  • 视觉代理行为:该模型可以充当视觉代理,具备推理能力并能动态指导工具用于电脑和手机使用。
  • 长视频理解:Qwen2.5-VL 支持时长超过一小时的视频,并能通过识别相关视频片段来定位特定事件。
  • 结构化输出生成:该模型可以从发票、表格和表单的扫描件生成结构化数据(如 JSON),便于在商业和金融领域使用。
  • 视觉定位:它能够使用边界框或点精准定位对象,提供坐标和属性的稳定 JSON 输出。
  • 高级视觉理解:该模型擅长识别常见物体,同时能够分析复杂文本、图表、图标、图形和布局。

性能基准

Qwen2.5-VL 在多个领域展现出竞争力的性能,包括大学水平问题、数学、文档理解和视频分析。

  • 旗舰模型 (72B-Instruct):实现了最先进的 (SOTA) 竞争性能,并在理解图表和文档方面表现出显著优势。无需任务特定微调即可充当视觉代理。
  • 中型模型 (7B-Instruct):在多项任务中优于 GPT-4o-mini。
  • 边缘 AI 解决方案 (3B):优于之前 Qwen2-VL 版本的 7B 模型。

技术深度解析:模型能力

文档解析与文本识别

Qwen2.5-VL 具备升级的 OCR 能力,在多语言、多方向和多场景文本识别方面性能提升。关键创新是 QwenVL HTML 格式,一种独特的文档解析格式,基于 HTML 提取布局信息,使模型能够解析杂志、研究论文、网页和移动端截屏。

对象定位与图像识别

该模型利用边界框和基于点的表示进行定位,实现层次化定位。其图像识别能力已扩展至涵盖大量类别,包括植物、动物、地标、电影/电视 IP 以及各种商业产品。

视频处理

为了增强时间处理能力,Qwen2.5-VL 实现了 动态帧率 (FPS) 训练绝对时间编码。这使模型能够实现秒级事件定位,并从小时级视频中提取关键点进行总结。

架构改进

相较于 Qwen2-VL,Qwen2.5-VL 优化了模型对空间和时间尺度的感知,并精简了视觉编码器以提高效率。

空间与时间感知

  • 空间:模型能够动态将不同尺寸的图像转换为长度不同的 token。它使用图像的实际尺度(而非传统的坐标归一化)来表示坐标(检测框和点),从而使模型能够直接学习图像尺度。
  • 时间:动态 FPS 训练和绝对时间编码使 mRoPE id 与时间速度对齐,使模型能够通过时间维度 id 间隔学习时间的节奏。

视觉编码器优化

Qwen 从零开始训练了一个原生动态分辨率 ViT。为了降低计算负载并解决负载不平衡问题,模型在大多数层采用 窗口注意力(最大窗口大小为 8x8),仅保留四层使用全注意力。ViT 架构也已更新为使用 RMSNorm 和 SwiGLU 结构,以保持与 LLMs 的一致性。

Sources