Mistral OCR 4 發佈說明 / 有什麼新功能
Mistral AI 已宣布發佈 Mistral OCR 4,這是一款專為企業級文件智能設計的專業文件解析模型。該模型透過從簡單的文本轉換轉向文件的結構化表示,實現了文件提取的突破,並提供邊界框 (bounding boxes)、區塊分類 (block classification) 以及行內置信度分數 (inline confidence scores)。
技術能力與結構化輸出
OCR 4 將文件轉換為結構化數據。與專注於乾淨文本和表格的前幾代產品不同,OCR 4 為每個提取的元素提供以下元數據 (metadata):
- Bounding Boxes: 定位文本以進行上下文高亮顯示和可靠的數據管道。
- Block Classification: 識別內容區塊的角色(例如:標題、表格、方程式、簽名)。
- Confidence Scores: 生成每頁和每單詞的行內分數,以促進人工介入驗證 (human-in-the-loop verification) 和基於來源的引用。
這些結構化原語 (structural primitives) 允許下游系統不僅理解文件的內容,還能理解其空間佈局和每個元素的角色。這專門設計用於支持 RAG 的語義分塊 (semantic chunking)、代理工作流 (agentic workflows,例如表單填充和發票處理) 以及數據連接器的持續攝取。
性能與基準測試
Mistral AI 報告稱,OCR 4 在人類偏好和自動化基準測試中均優於領先的 OCR 和文件 AI 系統。
人類偏好評估
在針對 12 種以上語言的 600 多份文件的盲測排名中,獨立標註員更偏好 OCR 4 而非所有測試的領先系統,平均勝率為 72%。
自動化基準測試
OCR 4 在 OlmOCRBench (85.20) 獲得了最高總分,並在內部 Crawl Multilingual evaluation (.98) 中領先。它在 OmniDocBench 也獲得了 93.07 分。
Mistral AI 指出,由於基準測試評分工具中已知的限制(例如參考標註中的真值錯誤、等效的 LaTeX 數學符號、以及可能導致正確輸出被扣分的多欄位閱讀順序假設),這些自動化分數僅具備方向性而非決定性。
多語言支持
OCR 4 支持 170 種語言,涵蓋 10 個語言組,包括專業語言和低資源語言。根據內部評估,該模型在許多競爭系統性能下降的地方仍能保持高準確度。
部署與集成
OCR 4 是一款緊湊型模型,可以部署在單個容器中,允許企業客戶將文件數據保留在自己的基礎設施內,以符合數據駐留和合規性要求。
API 與文件 AI 選項
開發者可以透過單個 API 端點集成該模型,並提供兩種主要的用法模式:
- Pure Extraction Mode: 提供原始提取的內容、邊界框、區塊類型和置信度分數。這是透過 Batch API 進行大批量攝取的最優選擇。
- Document AI Capabilities: 透過添加特定參數,OCR 輸出會被饋送至
mistral-small-2603以根據用戶定義的 schema 生成結構化 JSON,或使用視覺語言模型對圖像進行標註,或根據自定義提示詞 (prompt) 總結內容。
定價
- OCR 4 API: 每 1,000 頁 $4 (對於 Batch-API 提供 50% 折扣,將成本降低至每 1,000 頁 $2)。
- Document AI: 每 1,000 頁 $5。
生態系統與可用性
OCR 4 與 Mistral Search Toolkit 集成,這是一個開源的可組合搜索框架。它作為一個攝取組件,為 RAG 和企業搜索管道提供準備好用於引用的輸入。
該模型可透過 Mistral Studio、Amazon SageMaker、Microsoft Foundry 使用,並將很快在 Snowflake Parse Document 上可用。企業客戶亦可選擇自託管選項。
Sources
- OriginalIntroducing Mistral OCR 4
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch