Qwen-VL-Plus 和 Qwen-VL-Max 发布
Qwen 推出了 Qwen-VL-Plus 和 Qwen-VL-Max,两个 Qwen-VL 系列的增强版。这些模型显著提升了图像相关推理、细节识别能力,并能够处理分辨率超过一百万像素且任意宽高比的高清图像。
模型对比:Qwen-VL-Plus vs. Qwen-VL-Max
Qwen 提供了两个不同版本的增强视觉语言模型,以平衡性能和能力:
- Qwen-VL-Plus:一种增强的大型视觉语言模型,旨在实现细节识别和文本识别能力,支持超高像素分辨率和任意宽高比。
- Qwen-VL-Max:系列中最强大的模型,在视觉推理和指令遵循能力上进一步提升,以实现更高层次的认知理解和复杂任务。
Qwen-VL-Plus 和 Qwen-VL-Max 在多个文本-图像多模态任务上与 Gemini Ultra 和 GPT-4V 相当。值得注意的是,Qwen-VL-Max 在中文问答和中文文本理解方面优于 GPT-4V 和 Gemini。
| 模型 | DocVQA | ChartQA | AI2D | TextVQA | MMMU | MathVista | MM-Bench-CN |
|---|---|---|---|---|---|---|---|
| 其他最佳开源 LVLM | 81.6% | 68.4% | 73.7% | 76.1% | 45.9% | 36.7% | 72.4% |
| Gemini Pro | 88.1% | 74.1% | 73.9% | 74.6% | 47.9% | 45.2% | 74.3% |
| Gemini Ultra | 90.9% | 80.8% | 79.5% | 82.3% | 59.4% | 53.0% | - |
| GPT-4V | 88.4% | 78.5% | 78.2% | 78.0% | 56.8% | 49.9% | 73.9% |
| Qwen-VL-Plus | 91.4% | 78.1% | 75.9% | 78.9% | 45.2% | 43.3% | 68.0% |
| Qwen-VL-Max | 93.1% | 79.8% | 79.3% | 79.5% | 51.4% | 50.0% | 75.1% |
关键技术能力
高分辨率图像处理
Qwen-VL-Plus 和 Qwen-VL-Max 支持分辨率超过一百万像素且宽高比多样的图像,能够更精确地识别图像和文本中的细节。
视觉推理与问题求解
除了简单描述外,模型还能解释诸如流程图、示意图和符号系统等复杂表示。这包括数学问题求解以及图表和图形的分析。
视觉代理与定位
模型具备定位并查询图像中特定元素的能力,例如突出显示特定对象(如红色汽车),并基于场景的相同上下文做出决策。
文本信息识别
Qwen-VL-Plus/Max 在中文和英文文本识别方面有显著提升。它们能够高效地从文档和表格中提取信息,并将其重新格式化为自定义输出格式,如 JSON,以进行密集文本处理。
可用性
Qwen-VL-Plus 和 Qwen-VL-Max 可通过以下方式获取:
- Huggingface Spaces:提供 Plus 和 Max 两个版本的演示。
- QianWen Web Portal:Qwen-VL-Max 的图像理解模式。
- Dashscope APIs:提供两个模型的 API 访问。
Sources
- OriginalIntroducing Qwen-VL