Mistral OCR 发布说明
Mistral AI 推出了 Mistral OCR,这是一款光学字符识别(OCR)API,旨在将复杂的数字化文档转换为结构化、可供人工智能使用的格式。通过高精度提取交错的文本和图像,Mistral OCR 可将多模态文档(如科学论文、幻灯片和复杂 PDF 文件)集成到检索增强生成(RAG)系统中。
高精度文档理解
Mistral OCR 提供了对复杂文档元素(包括数学表达式、表格、交错图像和 LaTeX 格式)的业界领先理解能力。该模型专为处理包含图表、图形和方程式的丰富文档(如科学论文)而设计,能够以有序交错的文本和图像形式输出内容(例如,导出为 Markdown 文件)。
性能基准测试
Mistral OCR 2503 在多个文档分析维度上超越了多个主流 OCR 模型。在使用出版论文和网页 PDF 的内部“仅文本”测试中,Mistral OCR 在所有测量类别中均取得最高分:
| 模型 | 总体 | 数学 | 多语言 | 扫描文档 | 表格 |
|---|---|---|---|---|---|
| Mistral OCR 2503 | 94.89 | 94.29 | 89.55 | 98.96 | 96.12 |
| Gemini-1.5-Flash-002 | 90.23 | 89.11 | 86.76 | 94.87 | 90.48 |
| GPT-4o-2024-11-20 | 89.77 | 87.55 | 86.00 | 94.58 | 91.70 |
| Azure OCR | 89.52 | 85.72 | 87.52 | 94.65 | 89.52 |
| Google Document AI | 83.42 | 80.29 | 86.42 | 92.77 | 78.16 |
多语言能力
Mistral OCR 原生支持多语言,能够解析和转录数千种脚本、字体和语言。其在“生成中的模糊匹配”方面表现优于 Azure OCR(97.31)、Gemini-2.0-Flash-001(96.53)和 Google-Document-AI(95.88),得分高达 99.02。
Mistral OCR 2503 的具体语言基准测试结果如下:
- 西班牙语 (es): 99.54
- 德语 (de): 99.51
- 葡萄牙语 (pt): 99.42
- 意大利语 (it): 99.42
- 法语 (fr): 99.20
- 乌克兰语 (uk): 99.29
- 俄语 (ru): 99.09
- 印地语 (hi): 97.55
- 中文 (zh): 97.11
- 土耳其语 (tr): 97.00
- 罗马尼亚语 (ro): 98.79
技术特性与部署
速度与吞吐量
Mistral OCR 设计轻量,可在单个节点上实现每分钟处理高达 2,000 页的速度。
文档即提示与结构化输出
该 API 支持“文档即提示”功能,允许用户通过提供具体指令,将文档中的信息提取为 JSON 等结构化格式。这使得提取的数据可被链式调用至下游函数,并用于构建 AI 代理。
可用性与定价
- API:
mistral-ocr-latest模型可通过 la Plateforme 获取,价格为每 1,000 页 1 美元,通过批量推理可实现每美元约两倍的页数。 - Le Chat: Mistral OCR 是 Le Chat 用户进行文档理解的默认模型。
- 自托管: 对于拥有高度敏感或机密信息的组织,可选择性提供本地部署。
主要应用场景
- 科学研究: 将期刊和论文转换为 AI 友好格式,以加速协作与工作流程。
- 文化遗产: 数字化历史文献与文物,用于保存和公众访问。
- 客户服务: 将手册和文档转换为索引知识库,以缩短响应时间。
- 专业文献: 将工程图纸、监管文件和讲义转换为可直接回答问题的格式。
Sources
- OriginalMistral OCR
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch