Qwen2.5-VL-32B 发布说明

Qwen 已发布 Qwen2.5-VL-32B-Instruct,这是一款利用强化学习提升数学推理和图像理解能力的视觉语言(VL)模型。该模型在 Apache 2.0 许可证下开源。

关键改进与能力

Qwen2.5-VL-32B-Instruct 在之前的 Qwen2.5-VL 系列模型基础上引入了三项主要优化:

  • Human Preference Alignment:输出风格已调整,以提供更详细、更格式化的答案,更贴合人类偏好。
  • Enhanced Mathematical Reasoning:模型在解决复杂数学问题时的准确率显著提升。
  • Fine-grained Image Understanding:在图像解析、内容识别和视觉逻辑推理等任务中,模型的准确性和细致分析能力得到提升。

性能基准

Qwen2.5-VL-32B-Instruct 在性能上优于可比模型,如 Mistral-Small-3.1-24B 和 Gemma-3-27B-IT。值得注意的是,它在多个关键领域超越了更大的 Qwen2-VL-72B-Instruct

  • Multimodal Reasoning:模型在聚焦复杂多步骤推理的基准测试中表现出显著优势,具体包括 MMMUMMMU-ProMathVista
  • User Experience:在评估主观用户体验的 MM-MT-Bench 上,Qwen2.5-VL-32B-Instruct 以大幅优势超越 Qwen2-VL-72B-Instruct。
  • Text Capabilities:在纯文本能力方面,模型相较于同规模的其他模型也达到了顶级表现。

实际中的视觉推理

模型的能力通过需要将视觉数据与逻辑、数学步骤相结合的复杂视觉任务得以展示:

  • Visual Logic Deduction:在驾驶场景中,模型能够识别限速标志(卡车限速 100 km/h),计算特定距离(110 km)的行驶时间,并判断是否能在指定时间内到达目的地。
  • Geometric Reasoning:模型可以通过分析图像中的交叉线和角平分线来求解几何问题,计算特定角度的数值。
  • Detailed Image Parsing:模型能够识别图像中的特定文化标识(如红辣椒与花椒底料以及分格锅的设计),从而准确判断该菜品为四川麻辣火锅。

未来研究方向

虽然 Qwen2.5-VL-32B 致力于通过“快速思考”范式优化主观体验和数学推理,但 Qwen 团队表示,他们的下一步研究重点将是 long and effective reasoning processes(长期且有效的推理过程)。此方向旨在突破视觉模型在解决高度复杂、多步骤视觉推理任务方面的界限。

Sources