Pixtral 12B 发布说明

Mistral AI 宣布推出 Pixtral 12B,这是一款原生多模态模型,专为处理交错的图像和文本数据而设计。Pixtral 12B 被定位为 Mistral Nemo 12B 的即插即用替代品,在保持文本基准测试(包括编程、数学和指令遵循)高性能的同时,提供业界领先的多模态推理能力。

技术架构

Pixtral 12B 采用由视觉编码器和多模态 Transformer 解码器组成的双组件架构。

视觉编码器与可变图像支持

Pixtral 配备了一个全新的 4 亿参数视觉编码器,从零开始训练。一项关键技术进步是其对可变图像尺寸和宽高比的原生支持。图像以原始分辨率通过编码器,每 16x16 像素块转换为图像标记。为了保持空间感知能力,模型使用 [IMG BREAK] 标记区分行,使用 [IMG END] 标记标记图像结束。这使得模型能够高效处理高分辨率复杂图表和图形,同时保持对小图像的快速推理。

多模态解码器与上下文窗口

该模型采用基于 Mistral Nemo 的 120 亿参数多模态解码器。它在交错的图像和文本数据上进行训练,以预测下一个文本标记。该架构支持在长达 128K 标记的长上下文窗口内处理多张图像。

性能与基准测试

Pixtral 12B 的设计目标是在不降低其基础文本模型文本能力的前提下,实现业界一流的多模态推理能力。

多模态推理

Pixtral 在 MMMU 推理基准测试中取得了 52.5% 的得分,超越了多个更大模型。它在文档问答、图表和图像理解以及多模态推理方面表现出色。

指令遵循

与其它开源多模态模型相比,Pixtral 在指令遵循方面具有显著优势。Mistral AI 报告称,其在文本 IF-EvalMT-Bench 上相比最近的开源(OSS)模型有 20% 的相对提升。为验证这些声明,Mistral AI 开发了这些基准测试的多模态版本 MM-IF-EvalMM-MT-Bench,在这些测试中 Pixtral 同样优于开源替代方案。

对比评估

使用一致的评估工具和提示,Pixtral 与开源和闭源模型进行了对比。结果表明,Pixtral 显著优于同规模的开源模型,并在多模态基准测试中达到或超过更大模型(如 LLaVa OneVision 72B)的性能。在某些情况下,它甚至优于闭源模型如 Claude 3 Haiku。

功能与应用场景

Pixtral 12B 能够处理多种复杂的视觉任务:

  • 复杂图形推理: 从视觉图表中提取并结构化数据(例如,从图表中识别 GDP 最高的国家)。
  • 图表分析: 解读训练损失曲线,并识别数据趋势中的特定故障点。
  • 多图像处理: 将多个基于图像的表格信息整合为一个结构化的 Markdown 表格。
  • 图像到代码生成: 将视觉网站原型图转换为功能性的 HTML 和 CSS 代码。
  • 自然场景理解: 解读自然照片中的视觉错觉和空间关系。

可用性与许可

Pixtral 12B 采用 Apache 2.0 许可证发布。可通过以下方式访问:

  • Le Chat: Mistral AI 的对话式聊天界面。
  • La Plateforme: 通过 API 提供,可用于集成到应用程序中。
  • 本地部署: 通过 mistral-inference 和 vLLM 库支持,实现更高的服务吞吐量。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch