Mistral OCR 發佈說明

Mistral AI 推出了 Mistral OCR,這是一款光學字元辨識 (OCR) API,旨在將複雜的數位化文件轉換為結構化、AI 就緒的格式。透過高精度地提取交錯的文本與圖像,Mistral OCR 能夠將多模態文件(例如科學論文、簡報和複雜的 PDF)整合到檢索增強生成 (RAG) 系統中。

高精度文件理解

Mistral OCR 提供對複雜文件元素的頂尖理解能力,包括數學表達式、表格、交錯的圖像以及 LaTeX 格式。該模型專門設計用於處理包含圖表、圖形和方程式的豐富文件(如科學論文),並將內容輸出為有序的交錯文本與圖像(例如,輸出為 Markdown 檔案)。

性能基準測試

Mistral OCR 2503 在文件分析的多個維度上優於數款領先的 OCR 模型。在針對出版論文和網頁 PDF 的內部「僅限文本」測試中,Mistral OCR 獲得了所有衡量類別中的最高分:

Model Overall Math Multilingual Scanned Tables
Mistral OCR 2503 94.89 94.29 89.55 98.96 96.12
Gemini-1.5-Flash-002 90.23 89.11 86.76 94.87 90.48
GPT-4o-2024-11-20 89.77 87.55 86.00 94.58 91.70
Azure OCR 89.52 85.72 87.52 94.65 89.52
Google Document AI 83.42 80.29 86.42 92.77 78.16

多語言能力

Mistral OCR 原生支持多語言,能夠解析並轉錄數千種文字、字體和語言。與 Azure OCR (97.31)、Gemini-2.0-Flash-001 (96.53) 和 Google-Document-AI (95.88) 相比,它展現了卓越的「生成中的模糊匹配 (Fuzzy Match in Generation)」性能 (99.02)。

Mistral OCR 2503 的特定語言基準測試包括:

  • Spanish (es): 99.54
  • German (de): 99.51
  • Portuguese (pt): 99.42
  • Italian (it): 99.42
  • French (fr): 99.20
  • Ukrainian (uk): 99.29
  • Russian (ru): 99.09
  • Hindi (hi): 97.55
  • Chinese (zh): 97.11
  • Turkish (tr): 97.00
  • Romanian (ro): 98.79

技術特性與部署

速度與吞吐量

Mistral OCR 設計輕量化,允許單個節點每分鐘處理多達 2,000 頁。

Doc-as-Prompt 與結構化輸出

該 API 支持「doc-as-prompt」,允許用戶提供特定指令以從文件中提取資訊並轉換為 JSON 等結構化格式。這使得提取的數據可以鏈接到下游的函數調用並用於創建 AI 代理 (AI agents)。

可用性與定價

  • API: mistral-ocr-latest 模型可透過 la Plateforme 使用,費用為每 1,000 頁 1 美元,透過批次推理 (batch inference) 使用時,每美元可獲得約兩倍的頁數。
  • Le Chat: Mistral OCR 是 Le Chat 用戶的文件理解默認模型。
  • Self-Hosting: 對於擁有高度敏感或機密資訊的組織,可根據需求提供本地部署選項。

主要使用場景

  • 科學研究: 將期刊和論文轉換為 AI 就緒的格式,以加速協作與工作流程。
  • 文化遺產: 將歷史文件和文物數位化,以進行保存與公開存取。
  • 客戶服務: 將手冊和文件轉換為索引化的知識庫,以減少回應時間。
  • 專業文獻: 將工程圖紙、法規文件和講義轉換為可直接用於回答的格式。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch