QVQ-Max 视觉推理模型发布

Qwen 正式发布了 QVQ-Max,这是一款旨在超越简单图像理解,实现主动分析和问题解决的视觉推理模型。QVQ-Max 将视觉感知与深度推理相结合,能够解决从复杂数学问题到创意内容生成等多种任务。

扩展思考过程以提升数学准确性

QVQ-Max 展示了其内部思考过程长度与在 MathVision 基准上准确率之间的直接相关性。通过调整模型思考过程的最大长度,Qwen 观察到准确率持续提升,这表明模型的推理能力会随分配给“思考”的计算预算而扩展。

核心技术能力

QVQ-Max 被构建为一位既“眼光敏锐”又“思维敏捷”的助手,专注于三个主要功能领域:

细致观察

QVQ-Max 解析复杂的视觉输入,包括图表和日常快照,以识别关键要素、文字标签以及标准模型可能忽略的细微细节。

深度推理

模型将视觉观察与背景知识相结合,以得出结论。这包括基于图示解答几何题,以及根据当前场景预测视频片段中的未来事件。

灵活应用

除了分析,QVQ-Max 将其推理应用于创意和实用任务,例如:

  • 将粗略草图完善为完整插图。
  • 生成短视频脚本。
  • 创作角色扮演内容。
  • 对上传的照片提供批评或解读。

实际应用场景

QVQ-Max 旨在在三个主要领域提供实用价值:

  • 工作场所:协助进行数据分析、信息组织和代码生成。
  • 教育:解决依赖图示的复杂数学和物理问题,并直观地解释复杂概念。
  • 日常生活:提供实用建议,例如根据衣橱照片推荐搭配,或根据图片引导用户完成食谱。

未来发展路线图

Qwen 已确定 QVQ-Max 未来演进的三个主要方向:

  1. 提升观察准确性:采用 grounding 技术验证视觉观察。
  2. 视觉代理能力:提升模型执行多步骤复杂任务的能力,包括操作电脑、智能手机以及玩游戏。
  3. 多模态交互:将交互扩展至文本之外,涵盖工具验证和视觉生成。

Sources