Mistral OCR 3 發佈說明

Mistral AI 已宣布發佈 Mistral OCR 3,這是一款旨在從多種文件類型中高保真度提取文本和圖像的文件解析模型。該模型在處理表單、掃描文件、複雜表格和手寫內容方面的準確度顯著提高,與 Mistral OCR 2 相比,整體勝率達到了 74%。

技術能力與文件支持

Mistral OCR 3 旨在處理各種組織和日常文件類型,超越了許多現有 OCR 解決方案的專業化限制。關鍵技術升級包括:

  • 手寫識別: 模型可以準確地解讀草書文本、混合內容註釋以及疊加在印刷表單上的手寫條目。
  • 表單處理: Mistral OCR 3 具備改進的標籤、框選和密集佈局內手寫條目的檢測能力,使其適用於發票、收據和政府文件。
  • 掃描文件魯棒性: 系統對於低 DPI、背景噪聲、傾斜、失真和壓縮偽影具有更強的韌性。
  • 複雜表格重建: 模型可以重建表格結構,包括合併單元格、列層級結構和多行區塊。它輸出使用 colspanrowspan 的 HTML 表格標籤,以保留原始佈局。

集成與輸出格式

Mistral OCR 3 支持富含 HTML 表格重建的 markdown 輸出,使下游系統能夠同時理解內容和結構。

開發人員可以通過 API 使用模型識別碼 mistral-ocr-2512 集成該模型。該模型也可以通過 Mistral AI Studio 中的 Document AI Playground 使用,提供拖放界面來將 PDF 和圖像解析為乾淨的文本或結構化的 JSON。

定價與部署選項

Mistral OCR 3 與大多數競爭解決方案相比是一個較小的模型,這使得它能夠擁有具備競爭力的定價結構:

  • 標準 API 定價: 每 1,000 頁 $2。
  • Batch-API 折扣: 50% 的折扣將成本降低至每 1,000 頁 $1。

對於具有嚴格數據隱私和監管要求的組織,Mistral AI 提供自託管選項,以確保敏感信息保留在組織自己的基礎設施中。

推薦使用場景

Mistral OCR 3 專為高容量企業流水線和交互式工作流設計,包括:

  • 將文件轉換為 markdown 以供知識系統和 AI 代理使用。
  • 自動化解析操作文件、發票和表單。
  • 將歷史或手寫檔案數位化。
  • 構建端到端的文件理解流水線。

根據 IDC AI 和自動化研究總監 Tim Law 的說法,""OCR 仍然是實現生成式 AI 和代理式 AI 的基礎,"" 他指出,高保真度提取提供了更豐富的上下文,並為組織數據提供了競爭優力。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch