Mistral OCR 4 发布说明 / 新功能介绍

Mistral AI 已宣布发布 Mistral OCR 4,这是一款专为企业级文档智能设计的文档解析模型。该模型在文档提取方面实现了突破,不再局限于简单的文本转换,而是提供文档的结构化表示,包括边界框、区块分类和内联置信度分数。

技术能力与结构化输出

OCR 4 将文档转换为结构化数据。与以往专注于干净文本和表格的版本不同,OCR 4 为每个提取的元素提供以下元数据:

  • 边界框:定位文本,支持上下文高亮和可靠的数 据流水线。
  • 区块分类:识别内容区块的角色(例如标题、表格、公式、签名)。
  • 置信度分数:为每页和每个词生成内联分数,便于人机协作验证和基于源文档的引用。

这些结构化基础组件使下游系统不仅能理解文档内容,还能理解其空间布局以及每个元素的作用。这特别适用于 RAG 的语义分块、代理工作流(如表单填写和发票处理)以及数据连接器的一致性数据摄取。

性能与基准测试

Mistral AI 表示,OCR 4 在人类偏好和自动化基准测试中均优于领先的 OCR 和文档 AI 系统。

人类偏好评估

在对 600 多份文档、12 种以上语言的盲测排名中,独立标注员对 OCR 4 的偏好度超过所有测试的主流系统,胜率平均达到 72%。

自动化基准测试

OCR 4 在 OlmOCRBench(85.20) 上获得最高总分,并在内部 Crawl 多语言评估(.98) 中领先。它在 OmniDocBench 上也取得了 93.07 的成绩。

Mistral AI 指出,由于基准测试评分中存在已知局限性(如参考标注中的真实值错误、等效的 LaTeX 数学表示、多列阅读顺序假设可能惩罚正确输出),这些自动化评分仅具有方向性,而非绝对定论。

多语言支持

OCR 4 支持 170 种语言,涵盖 10 个语言组,包括专业语言和低资源语言。根据内部评估,该模型在许多竞争系统性能下降的场景下仍保持高准确率。

部署与集成

OCR 4 是一个轻量级模型,可部署在单个容器中,使企业客户能够将文档数据保留在自有基础设施中,满足数据驻留和合规要求。

API 与文档 AI 选项

开发者可通过单一 API 端点集成该模型,支持两种主要使用模式:

  1. 纯提取模式:提供原始提取内容、边界框、区块类型和置信度分数。这是通过批处理 API 进行高吞吐量批量摄取的最佳选择。
  2. 文档 AI 功能:通过添加特定参数,OCR 输出将被送入 mistral-small-2603,以根据用户定义的模式生成结构化 JSON,使用视觉语言模型为图像添加注释,或根据自定义提示总结内容。

定价

  • OCR 4 API:每 1,000 页 4 美元(批量 API 享有 50% 折扣,降至每 1,000 页 2 美元)。
  • 文档 AI:每 1,000 页 5 美元。

生态系统与可用性

OCR 4 已集成至 Mistral Search Toolkit,这是一个开源的可组合搜索框架。它作为摄取组件,为 RAG 和企业搜索流水线提供可引用的输入。

该模型可通过 Mistral Studio、Amazon SageMaker、Microsoft Foundry 获取,不久后也将上线 Snowflake Parse Document。企业客户还可选择自托管方案。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch