Mistral OCR 发布说明

Mistral AI 推出了 Mistral OCR,这是一款光学字符识别(OCR)API,旨在将复杂的数字化文档转换为结构化、可供人工智能使用的格式。通过高精度提取交错的文本和图像,Mistral OCR 可将多模态文档(如科学论文、幻灯片和复杂 PDF 文件)集成到检索增强生成(RAG)系统中。

高精度文档理解

Mistral OCR 提供了对复杂文档元素(包括数学表达式、表格、交错图像和 LaTeX 格式)的业界领先理解能力。该模型专为处理包含图表、图形和方程式的丰富文档(如科学论文)而设计,能够以有序交错的文本和图像形式输出内容(例如,导出为 Markdown 文件)。

性能基准测试

Mistral OCR 2503 在多个文档分析维度上超越了多个主流 OCR 模型。在使用出版论文和网页 PDF 的内部“仅文本”测试中,Mistral OCR 在所有测量类别中均取得最高分:

模型 总体 数学 多语言 扫描文档 表格
Mistral OCR 2503 94.89 94.29 89.55 98.96 96.12
Gemini-1.5-Flash-002 90.23 89.11 86.76 94.87 90.48
GPT-4o-2024-11-20 89.77 87.55 86.00 94.58 91.70
Azure OCR 89.52 85.72 87.52 94.65 89.52
Google Document AI 83.42 80.29 86.42 92.77 78.16

多语言能力

Mistral OCR 原生支持多语言,能够解析和转录数千种脚本、字体和语言。其在“生成中的模糊匹配”方面表现优于 Azure OCR(97.31)、Gemini-2.0-Flash-001(96.53)和 Google-Document-AI(95.88),得分高达 99.02。

Mistral OCR 2503 的具体语言基准测试结果如下:

  • 西班牙语 (es): 99.54
  • 德语 (de): 99.51
  • 葡萄牙语 (pt): 99.42
  • 意大利语 (it): 99.42
  • 法语 (fr): 99.20
  • 乌克兰语 (uk): 99.29
  • 俄语 (ru): 99.09
  • 印地语 (hi): 97.55
  • 中文 (zh): 97.11
  • 土耳其语 (tr): 97.00
  • 罗马尼亚语 (ro): 98.79

技术特性与部署

速度与吞吐量

Mistral OCR 设计轻量,可在单个节点上实现每分钟处理高达 2,000 页的速度。

文档即提示与结构化输出

该 API 支持“文档即提示”功能,允许用户通过提供具体指令,将文档中的信息提取为 JSON 等结构化格式。这使得提取的数据可被链式调用至下游函数,并用于构建 AI 代理。

可用性与定价

  • API: mistral-ocr-latest 模型可通过 la Plateforme 获取,价格为每 1,000 页 1 美元,通过批量推理可实现每美元约两倍的页数。
  • Le Chat: Mistral OCR 是 Le Chat 用户进行文档理解的默认模型。
  • 自托管: 对于拥有高度敏感或机密信息的组织,可选择性提供本地部署。

主要应用场景

  • 科学研究: 将期刊和论文转换为 AI 友好格式,以加速协作与工作流程。
  • 文化遗产: 数字化历史文献与文物,用于保存和公众访问。
  • 客户服务: 将手册和文档转换为索引知识库,以缩短响应时间。
  • 专业文献: 将工程图纸、监管文件和讲义转换为可直接回答问题的格式。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch