Pixtral Large 发布说明

Mistral AI 推出了 Pixtral Large,这是一个 1240 亿参数的开源多模态模型,专为前沿级别的图像理解而设计。该模型基于 Mistral Large 2 构建,能够在不牺牲基础模型原有纯文本理解能力的前提下,实现对文档、图表和自然图像的高性能处理。

模型架构与规格

Pixtral Large 采用多模态解码器和视觉编码器来处理视觉与文本数据。其技术规格包括:

  • 参数量: 1230 亿参数的多模态解码器,搭配 10 亿参数的视觉编码器(总计 1240 亿参数)。
  • 上下文窗口: 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
  • 可用性: 可通过 Mistral API 使用 pixtral-large-latest,在 le Chat 上使用,以及在 HuggingFace 上以开源权重形式获取。
  • 许可协议: 用于研究和教育用途的 Mistral Research License(MRL),以及用于生产环境和商业实验的独立 Mistral Commercial License。

性能基准测试

Pixtral Large 在多个多模态基准测试中表现出顶尖性能,经常超越其他开源和专有模型。

数学与文档推理

在测试视觉数据上复杂数学推理能力的 MathVista 基准测试中,Pixtral Large 达到了 69.4% 的得分,优于所有其他测试模型。在使用 ChartQA 和 DocVQA 对复杂图表和文档进行评估时,该模型的表现超过了 GPT-4o 和 Gemini-1.5 Pro。

现实场景与人类偏好评估

在 MM-MT-Bench 上,这是一个开源、基于裁判的评估,旨在反映真实世界多模态大模型的使用场景,Pixtral Large 的表现优于 Claude-3.5 Sonnet(新)、Gemini-1.5 Pro 和 GPT-4o(最新)。此外,在 LMSys Vision Leaderboard 上,Pixtral Large 是排名最高的开源权重模型,领先其最近的竞争对手近 50 ELO 分,并且超越了 GPT-4o 2024 年 8 月版本等专有模型。

视觉理解能力

Pixtral Large 能够在多种视觉格式上进行复杂推理,包括:

  • 多语言 OCR 与推理: 模型能够从图像中提取数据(例如不同语言的收据),并基于这些数据执行数学计算。
  • 图表分析: 模型能够识别技术数据中的特定趋势和异常,例如在损失曲线图中准确识别训练损失不稳定的起始步骤数。
  • 视觉信息提取: 模型能够准确识别并列出网站截图中的实体(例如公司名称)。

Mistral Large 24.11 更新

与 Pixtral Large 发布同步,Mistral AI 将其最先进的文本模型更新至 24.11 版本。此次更新相比 24.07 版本有显著提升,特别是在:

  • 长上下文理解
  • 函数调用准确性
  • 系统提示处理

Mistral Large 24.11 适用于企业级 RAG 和智能体工作流,包括任务自动化和语义文档理解。它可通过 API 以 pixtral-large-latest 调用,也可在 HuggingFace 上进行自部署。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch