Mistral OCR 3 发布说明

Mistral AI 已宣布发布 Mistral OCR 3,这是一款旨在以高保真度从各种文档类型中提取文本和图像的文档解析模型。该模型在处理表格、扫描文档、复杂表格和手写内容方面显著提升了准确性,相较于 Mistral OCR 2 实现了 74% 的整体胜率。

技术能力与文档支持

Mistral OCR 3 经过专门设计,可处理多种组织和个人日常文档类型,突破了大多数现有 OCR 解决方案的专精局限。主要技术升级包括:

  • 手写识别: 该模型能准确解析连笔文字、混合内容注释以及叠加在印刷表单上的手写条目。
  • 表单处理: Mistral OCR 3 在密集布局中对标签、方框和手写条目的检测能力得到提升,适用于发票、收据和政府文件。
  • 扫描文档鲁棒性: 系统对低 DPI、背景噪声、倾斜、失真和压缩伪影的抗干扰能力更强。
  • 复杂表格重建: 该模型可重建包含合并单元格、列层级和多行块的表格结构。输出采用 HTML 表格标签,使用 colspanrowspan 以保留原始布局。

集成与输出格式

Mistral OCR 3 支持以 HTML 表格重建增强的 Markdown 输出,使下游系统能够同时理解内容与结构。

开发者可通过 API 使用模型标识符 mistral-ocr-2512 集成该模型。该模型也可通过 Mistral AI Studio 中的 Document AI Playground 使用,提供拖放界面,将 PDF 和图像解析为干净的文本或结构化 JSON。

定价与部署选项

相较于大多数竞争解决方案,Mistral OCR 3 是一个更小的模型,从而实现了具有竞争力的定价结构:

  • 标准 API 定价: 每 1,000 页 2 美元。
  • 批量 API 优惠: 50% 折扣后,成本降至每 1,000 页 1 美元。

对于有严格数据隐私和合规要求的组织,Mistral AI 提供自托管选项,确保敏感信息保留在组织自身的基础设施内。

推荐使用场景

Mistral OCR 3 专为高吞吐量企业流水线和交互式工作流设计,包括:

  • 将文档转换为 Markdown,用于知识系统和 AI 代理。
  • 自动化处理运营文档、发票和表单。
  • 数字化历史或手写档案。
  • 构建端到端的文档理解流水线。

IDC 人工智能与自动化研究总监 Tim Law 指出:"OCR 仍然是推动生成式 AI 和代理式 AI 的基础," 他强调,高保真提取能提供更丰富的上下文,并为组织数据带来竞争优势。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch