Pixtral Large 发布说明
Mistral AI 推出了 Pixtral Large,这是一个 1240 亿参数的开源多模态模型,专为前沿级别的图像理解而设计。该模型基于 Mistral Large 2 构建,能够在不牺牲基础模型原有纯文本理解能力的前提下,实现对文档、图表和自然图像的高性能处理。
模型架构与规格
Pixtral Large 采用多模态解码器和视觉编码器来处理视觉与文本数据。其技术规格包括:
- 参数量: 1230 亿参数的多模态解码器,搭配 10 亿参数的视觉编码器(总计 1240 亿参数)。
- 上下文窗口: 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
- 可用性: 可通过 Mistral API 使用
pixtral-large-latest,在 le Chat 上使用,以及在 HuggingFace 上以开源权重形式获取。 - 许可协议: 用于研究和教育用途的 Mistral Research License(MRL),以及用于生产环境和商业实验的独立 Mistral Commercial License。
性能基准测试
Pixtral Large 在多个多模态基准测试中表现出顶尖性能,经常超越其他开源和专有模型。
数学与文档推理
在测试视觉数据上复杂数学推理能力的 MathVista 基准测试中,Pixtral Large 达到了 69.4% 的得分,优于所有其他测试模型。在使用 ChartQA 和 DocVQA 对复杂图表和文档进行评估时,该模型的表现超过了 GPT-4o 和 Gemini-1.5 Pro。
现实场景与人类偏好评估
在 MM-MT-Bench 上,这是一个开源、基于裁判的评估,旨在反映真实世界多模态大模型的使用场景,Pixtral Large 的表现优于 Claude-3.5 Sonnet(新)、Gemini-1.5 Pro 和 GPT-4o(最新)。此外,在 LMSys Vision Leaderboard 上,Pixtral Large 是排名最高的开源权重模型,领先其最近的竞争对手近 50 ELO 分,并且超越了 GPT-4o 2024 年 8 月版本等专有模型。
视觉理解能力
Pixtral Large 能够在多种视觉格式上进行复杂推理,包括:
- 多语言 OCR 与推理: 模型能够从图像中提取数据(例如不同语言的收据),并基于这些数据执行数学计算。
- 图表分析: 模型能够识别技术数据中的特定趋势和异常,例如在损失曲线图中准确识别训练损失不稳定的起始步骤数。
- 视觉信息提取: 模型能够准确识别并列出网站截图中的实体(例如公司名称)。
Mistral Large 24.11 更新
与 Pixtral Large 发布同步,Mistral AI 将其最先进的文本模型更新至 24.11 版本。此次更新相比 24.07 版本有显著提升,特别是在:
- 长上下文理解
- 函数调用准确性
- 系统提示处理
Mistral Large 24.11 适用于企业级 RAG 和智能体工作流,包括任务自动化和语义文档理解。它可通过 API 以 pixtral-large-latest 调用,也可在 HuggingFace 上进行自部署。
Sources
- OriginalPixtral Large
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch