Pixtral 12B 发布说明
Mistral AI 宣布推出 Pixtral 12B,这是一款原生多模态模型,专为处理交错的图像和文本数据而设计。Pixtral 12B 被定位为 Mistral Nemo 12B 的即插即用替代品,在保持文本基准测试(包括编程、数学和指令遵循)高性能的同时,提供业界领先的多模态推理能力。
技术架构
Pixtral 12B 采用由视觉编码器和多模态 Transformer 解码器组成的双组件架构。
视觉编码器与可变图像支持
Pixtral 配备了一个全新的 4 亿参数视觉编码器,从零开始训练。一项关键技术进步是其对可变图像尺寸和宽高比的原生支持。图像以原始分辨率通过编码器,每 16x16 像素块转换为图像标记。为了保持空间感知能力,模型使用 [IMG BREAK] 标记区分行,使用 [IMG END] 标记标记图像结束。这使得模型能够高效处理高分辨率复杂图表和图形,同时保持对小图像的快速推理。
多模态解码器与上下文窗口
该模型采用基于 Mistral Nemo 的 120 亿参数多模态解码器。它在交错的图像和文本数据上进行训练,以预测下一个文本标记。该架构支持在长达 128K 标记的长上下文窗口内处理多张图像。
性能与基准测试
Pixtral 12B 的设计目标是在不降低其基础文本模型文本能力的前提下,实现业界一流的多模态推理能力。
多模态推理
Pixtral 在 MMMU 推理基准测试中取得了 52.5% 的得分,超越了多个更大模型。它在文档问答、图表和图像理解以及多模态推理方面表现出色。
指令遵循
与其它开源多模态模型相比,Pixtral 在指令遵循方面具有显著优势。Mistral AI 报告称,其在文本 IF-Eval 和 MT-Bench 上相比最近的开源(OSS)模型有 20% 的相对提升。为验证这些声明,Mistral AI 开发了这些基准测试的多模态版本 MM-IF-Eval 和 MM-MT-Bench,在这些测试中 Pixtral 同样优于开源替代方案。
对比评估
使用一致的评估工具和提示,Pixtral 与开源和闭源模型进行了对比。结果表明,Pixtral 显著优于同规模的开源模型,并在多模态基准测试中达到或超过更大模型(如 LLaVa OneVision 72B)的性能。在某些情况下,它甚至优于闭源模型如 Claude 3 Haiku。
功能与应用场景
Pixtral 12B 能够处理多种复杂的视觉任务:
- 复杂图形推理: 从视觉图表中提取并结构化数据(例如,从图表中识别 GDP 最高的国家)。
- 图表分析: 解读训练损失曲线,并识别数据趋势中的特定故障点。
- 多图像处理: 将多个基于图像的表格信息整合为一个结构化的 Markdown 表格。
- 图像到代码生成: 将视觉网站原型图转换为功能性的 HTML 和 CSS 代码。
- 自然场景理解: 解读自然照片中的视觉错觉和空间关系。
可用性与许可
Pixtral 12B 采用 Apache 2.0 许可证发布。可通过以下方式访问:
- Le Chat: Mistral AI 的对话式聊天界面。
- La Plateforme: 通过 API 提供,可用于集成到应用程序中。
- 本地部署: 通过
mistral-inference和 vLLM 库支持,实现更高的服务吞吐量。
Sources
- OriginalAnnouncing Pixtral 12B
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch