QVQ-72B-Preview 发布

Qwen 推出了 QVQ-72B-Preview,一个专为复杂多模态推理设计的开放权重模型。基于 Qwen2-VL-72B 构建,QVQ-72B-Preview 被设计用于提升 AI 在视觉理解和分析问题解决方面的能力,特别是在需要复杂逐步推理的领域。

性能基准测试

QVQ-72B-Preview 在视觉推理方面相比其前身 Qwen2-VL-72B-Instruct 表现出显著提升。该模型在四个主要数据集上进行了评估:

  • MMMU: 一种大学水平的多学科多模态评估数据集。QVQ-72B-Preview 取得了 70.3 分,显著领先于 Qwen2-VL-72B-Instruct。
  • MathVista: 一个专注于数学的视觉推理测试集,涵盖拼图图形、函数图和学术图表。
  • MathVision: 一个源自真实数学竞赛的多模态数学推理测试集。
  • OlympiadBench: 一个双语多模态科学基准,包含来自奥林匹克数学和物理竞赛的 8,476 道题目,包括中国高考。

在数学和科学基准测试中,QVQ-72B-Preview 有效地缩小了与最先进的 o1 模型之间的性能差距。

技术能力和推理过程

QVQ-72B-Preview 采用有条理的逐步推理方法来解决复杂的视觉任务。演示案例展示了其处理各种技术挑战的能力:

  • Mathematics: 模型可以应用导数的乘法法则来解决基于表格的微积分问题,并使用圆公式来评估绘制函数的积分。
  • Physical Volume Calculation: 模型可以将复杂的 L 形对象分解为长方体,并考虑重叠体积以计算总体积。
  • Chemistry: 模型可以分析化学流程图(例如,从黄铜矿中提取铜)以根据反应序列识别特定的化学物质。
  • Biology: 模型可以分析遗传图表以通过评估等位基因遗传来确定染色体异常的原因,例如 Klinefelter 综合征。
  • Geometry: 模型可以使用坐标几何和线性方程来计算随机点落在矩形内特定三角形内的概率。

模型局限性

作为一个实验研究模型,QVQ-72B-Preview 存在若干已知限制:

  • Language and Logic: 模型可能会出现意外的语言混合、代码切换,或陷入递归推理模式(循环逻辑),产生冗长但未得出结论的响应。
  • Reliability: 在多步骤视觉推理过程中,模型可能会失去对图像内容的关注,这可能导致幻觉。
  • Functional Scope: 它并非旨在完全取代 Qwen2-VL-72B-Instruct 的能力。
  • Safety: 该模型需要加强安全措施以实现安全部署。

未来发展

Qwen 旨在将 QVQ 发展为一个‘全能且智能’的模型。未来的开发将重点放在将更多模态集成到一个统一的模型中,以提升其在科学探索和解决复杂挑战方面的能力。

Sources