Mistral OCR 發佈說明
Mistral AI 推出了 Mistral OCR,這是一款光學字元辨識 (OCR) API,旨在將複雜的數位化文件轉換為結構化、AI 就緒的格式。透過高精度地提取交錯的文本與圖像,Mistral OCR 能夠將多模態文件(例如科學論文、簡報和複雜的 PDF)整合到檢索增強生成 (RAG) 系統中。
高精度文件理解
Mistral OCR 提供對複雜文件元素的頂尖理解能力,包括數學表達式、表格、交錯的圖像以及 LaTeX 格式。該模型專門設計用於處理包含圖表、圖形和方程式的豐富文件(如科學論文),並將內容輸出為有序的交錯文本與圖像(例如,輸出為 Markdown 檔案)。
性能基準測試
Mistral OCR 2503 在文件分析的多個維度上優於數款領先的 OCR 模型。在針對出版論文和網頁 PDF 的內部「僅限文本」測試中,Mistral OCR 獲得了所有衡量類別中的最高分:
| Model | Overall | Math | Multilingual | Scanned | Tables |
|---|---|---|---|---|---|
| Mistral OCR 2503 | 94.89 | 94.29 | 89.55 | 98.96 | 96.12 |
| Gemini-1.5-Flash-002 | 90.23 | 89.11 | 86.76 | 94.87 | 90.48 |
| GPT-4o-2024-11-20 | 89.77 | 87.55 | 86.00 | 94.58 | 91.70 |
| Azure OCR | 89.52 | 85.72 | 87.52 | 94.65 | 89.52 |
| Google Document AI | 83.42 | 80.29 | 86.42 | 92.77 | 78.16 |
多語言能力
Mistral OCR 原生支持多語言,能夠解析並轉錄數千種文字、字體和語言。與 Azure OCR (97.31)、Gemini-2.0-Flash-001 (96.53) 和 Google-Document-AI (95.88) 相比,它展現了卓越的「生成中的模糊匹配 (Fuzzy Match in Generation)」性能 (99.02)。
Mistral OCR 2503 的特定語言基準測試包括:
- Spanish (es): 99.54
- German (de): 99.51
- Portuguese (pt): 99.42
- Italian (it): 99.42
- French (fr): 99.20
- Ukrainian (uk): 99.29
- Russian (ru): 99.09
- Hindi (hi): 97.55
- Chinese (zh): 97.11
- Turkish (tr): 97.00
- Romanian (ro): 98.79
技術特性與部署
速度與吞吐量
Mistral OCR 設計輕量化,允許單個節點每分鐘處理多達 2,000 頁。
Doc-as-Prompt 與結構化輸出
該 API 支持「doc-as-prompt」,允許用戶提供特定指令以從文件中提取資訊並轉換為 JSON 等結構化格式。這使得提取的數據可以鏈接到下游的函數調用並用於創建 AI 代理 (AI agents)。
可用性與定價
- API:
mistral-ocr-latest模型可透過 la Plateforme 使用,費用為每 1,000 頁 1 美元,透過批次推理 (batch inference) 使用時,每美元可獲得約兩倍的頁數。 - Le Chat: Mistral OCR 是 Le Chat 用戶的文件理解默認模型。
- Self-Hosting: 對於擁有高度敏感或機密資訊的組織,可根據需求提供本地部署選項。
主要使用場景
- 科學研究: 將期刊和論文轉換為 AI 就緒的格式,以加速協作與工作流程。
- 文化遺產: 將歷史文件和文物數位化,以進行保存與公開存取。
- 客戶服務: 將手冊和文件轉換為索引化的知識庫,以減少回應時間。
- 專業文獻: 將工程圖紙、法規文件和講義轉換為可直接用於回答的格式。
Sources
- OriginalMistral OCR
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch