Qwen-VL-Plus 和 Qwen-VL-Max 发布

Qwen 推出了 Qwen-VL-Plus 和 Qwen-VL-Max,两个 Qwen-VL 系列的增强版。这些模型显著提升了图像相关推理、细节识别能力,并能够处理分辨率超过一百万像素且任意宽高比的高清图像。

模型对比:Qwen-VL-Plus vs. Qwen-VL-Max

Qwen 提供了两个不同版本的增强视觉语言模型,以平衡性能和能力:

  • Qwen-VL-Plus:一种增强的大型视觉语言模型,旨在实现细节识别和文本识别能力,支持超高像素分辨率和任意宽高比。
  • Qwen-VL-Max:系列中最强大的模型,在视觉推理和指令遵循能力上进一步提升,以实现更高层次的认知理解和复杂任务。

Qwen-VL-Plus 和 Qwen-VL-Max 在多个文本-图像多模态任务上与 Gemini Ultra 和 GPT-4V 相当。值得注意的是,Qwen-VL-Max 在中文问答和中文文本理解方面优于 GPT-4V 和 Gemini。

模型 DocVQA ChartQA AI2D TextVQA MMMU MathVista MM-Bench-CN
其他最佳开源 LVLM 81.6% 68.4% 73.7% 76.1% 45.9% 36.7% 72.4%
Gemini Pro 88.1% 74.1% 73.9% 74.6% 47.9% 45.2% 74.3%
Gemini Ultra 90.9% 80.8% 79.5% 82.3% 59.4% 53.0% -
GPT-4V 88.4% 78.5% 78.2% 78.0% 56.8% 49.9% 73.9%
Qwen-VL-Plus 91.4% 78.1% 75.9% 78.9% 45.2% 43.3% 68.0%
Qwen-VL-Max 93.1% 79.8% 79.3% 79.5% 51.4% 50.0% 75.1%

关键技术能力

高分辨率图像处理

Qwen-VL-Plus 和 Qwen-VL-Max 支持分辨率超过一百万像素且宽高比多样的图像,能够更精确地识别图像和文本中的细节。

视觉推理与问题求解

除了简单描述外,模型还能解释诸如流程图、示意图和符号系统等复杂表示。这包括数学问题求解以及图表和图形的分析。

视觉代理与定位

模型具备定位并查询图像中特定元素的能力,例如突出显示特定对象(如红色汽车),并基于场景的相同上下文做出决策。

文本信息识别

Qwen-VL-Plus/Max 在中文和英文文本识别方面有显著提升。它们能够高效地从文档和表格中提取信息,并将其重新格式化为自定义输出格式,如 JSON,以进行密集文本处理。

可用性

Qwen-VL-Plus 和 Qwen-VL-Max 可通过以下方式获取:

  • Huggingface Spaces:提供 Plus 和 Max 两个版本的演示。
  • QianWen Web Portal:Qwen-VL-Max 的图像理解模式。
  • Dashscope APIs:提供两个模型的 API 访问。

Sources