Mistral OCR 3 リリースノート
Mistral AI は、多様なドキュメント形式からテキストや画像を高精度で抽出するように設計されたドキュメント解析モデルである Mistral OCR 3 のリリースを発表しました。このモデルは、フォーム、スキャンされたドキュメント、複雑な表、手書き文字の処理において精度を大幅に向上させ、Mistral OCR 2 に対して全体で 74% の勝率を達成しています。
技術的機能とドキュメント対応
Mistral OCR 3 は、多くの既存の OCR ソリューションが特化している範囲を超えて、幅広い組織的および日常的なドキュメント形式を処理できるように設計されています。主な技術的アップグレードは以下の通りです:
- 手書き文字認識: カリグラフィー形式のテキスト、混合コンテンツの注釈、印刷されたフォームの上に重ねられた手書き入力も正確に解釈します。
- フォーム処理: ダークレイアウトにおけるラベル、ボックス、手書き入力の検出が向上しており、請求書、領収書、政府文書などに適しています。
- スキャンドキュメントの耐障害性: 低 DPI、背景ノイズ、歪み、歪み、圧縮アーティファクトに対してより強固です。
- 複雑な表の再構築: 合併セル、列の階層構造、複数行ブロックを含む表構造を再構築します。
colspanおよびrowspanを使用した HTML 表タグを出力することで、元のレイアウトを保持します。
統合と出力形式
Mistral OCR 3 は、HTML をベースにした表の再構築を強化した markdown 出力をサポートしており、下流システムがコンテンツと構造の両方を理解し続けることができます。
開発者は、モデル識別子 mistral-ocr-2512 を使用して API を通じてモデルを統合できます。また、Mistral AI Studio の Document AI Playground でも利用可能で、PDF や画像をドラッグアンドドロップしてクリーンなテキストまたは構造化 JSON に変換できます。
価格設定とデプロイオプション
Mistral OCR 3 は、大多数の競合製品と比較して小型のモデルであるため、競争力のある価格設定が可能です:
- 標準 API 価格: 1,000 ページあたり 2 ドル。
- バッチ API オフセット: 50% オフにより、1,000 ページあたり 1 ドルに低下します。
データプライバシーおよび規制要件が厳しい組織向けに、Mistral AI は自社ホスティングオプションを提供しており、機密情報が組織のインフラ内に留まるように保証します。
推奨される利用シーン
Mistral OCR 3 は、高ボリュームのエンタープライズパイプラインおよびインタラクティブなワークフローに最適化されています。具体的には以下の用途が想定されます:
- 知識システムや AI エージェント向けにドキュメントを markdown に変換。
- 業務ドキュメント、請求書、フォームの自動解析。
- 歴史的または手書きのアーカイブのデジタル化。
- エンドツーエンドのドキュメント理解パイプラインの構築。
IDC の AI およびオートメーション研究責任者である Tim Law 氏は、「OCR は生成型 AI およびエージェント型 AI を可能にする基盤であり続けている」と述べ、高精度な抽出がより豊かな文脈を提供し、組織のデータにおける競争優位性をもたらすと指摘しています。
Sources
- OriginalIntroducing Mistral OCR 3
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch