Hugging Face が文書AIを加速
Hugging Face は、Document AI を加速するためのフレームワークを詳細に示しており、企業が請求書、レポート、フォームなどの非デジタル文書に閉じ込められた知識をオープンソースのマルチモーダルモデルを使用して解放できるようにします。テキストのみのモデルからビジョン・ランゲージモデルへの移行により、テキストに加えて視覚的なレイアウトや構造を取り入れることで、精度が大幅に向上します。
Document AI のユースケースの分類
Document AI は、基本的なテキスト変換から複雑な視覚的推論まで、いくつかの異なるデータサイエンスタスクを包含しています。
光学文字認識 (OCR)
OCR は、タイプされた文字、手書き、印刷されたテキストを機械エンコードされたテキストに変換し、多くの Document AI ワークフローの基盤となります。
- Key Models: EasyOCR、PaddleOCR、TrOCR(単一テキスト行画像で動作し、しばしば CRAFT のような検出モデルと組み合わせて使用されます)。
- Evaluation Metrics: Character Error Rate (CER) と単語レベルの精度、再現率、F1。
文書画像分類
このタスクは、画像、テキスト、またはその両方を使用して文書(例:請求書や手紙)を分類することを含みます。視覚的構造とテキストを組み合わせたマルチモーダルモデルは、テキストのみのモデルを大幅に上回ります。
- Performance Comparison: RVL‑CDIP ベンチマークでは、テキストのみの BERT‑base モデルが 89% の精度を達成し、Document Image Transformer (DiT、ビジョンのみ) が 92% に達し、LayoutLMv3 や Donut といったマルチモーダルモデルが 95% を達成します。
文書レイアウト解析
レイアウト解析は、ヘッダー、テーブル、テキストセグメントなど、文書の物理的構造を特定するもので、通常はオブジェクト検出問題として定式化されます。
- Key Models: LayoutLMv3 と DiT(どちらもバックボーンに Mask R‑CNN を使用)。
- Benchmark: LayoutLMv3 は PubLayNet データセットで全体の mAP(平均精度)0.951 を達成しています。
文書パーシング
パーシングは、請求書から名前や合計金額といった特定のキー・バリューのペアを抽出します。
- Evolution of Models: LayoutLM ファミリー(v1、v2、v3)は性能に大きな飛躍をもたらしました。例えば、FUNSD ベンチマークでは、LayoutLM が 90% の F1 スコアを達成し、BERT は 60% にとどまります。
- End-to-End Approaches: Donut、Pix2Struct、UDOP といった新しい生成モデルや、LLaVa‑NeXT、Idefics2、PaliGemma といった大規模ビジョン・ランゲージモデルは、別個の OCR エンジンを必要とせずにエンドツーエンド(画像からテキスト)でパーシングを実行できます。
テーブル検出と抽出
これは、テーブルの位置を特定し、構造(行、列、セル)を認識し、機能的分析(キーとバリューの認識)を行うことを含みます。
- Key Models: Table Transformer(PubTables‑1M で学習された DETR ライクなモデル)。
- Performance: Table Transformer は PubTables‑1M において、テーブル検出で AP 0.966、構造認識と機能的分析で 0.912 を報告しています。
文書ビジュアル質問応答 (DocVQA)
DocVQA は、ユーザーが文書画像に関する質問を行い、テキストで回答を得ることを可能にします。
- Key Models: LayoutLMv3(OCR + マルチモーダル Transformer)は DocVQA ベンチマークで ANLS スコア 83.37 を達成しています。Donut、LLaVa‑NeXT、Idefics2 といったエンドツーエンドモデルは OCR の必要性を排除します。
- Risks: DocVQA モデルは、文書に存在しない回答を生成する「幻覚」や、学習データからのバイアスを引き継ぐリスクがあります。
エンタープライズ向け実装上の考慮点
ライセンスと商用利用
ライセンスはエンタープライズでの採用において重要な要素です。高性能なモデルの中には制限のあるライセンスが付いているものがあります。例えば、Microsoft の LayoutLMv2 と LayoutLMv3 のチェックポイントは商用利用が許可されていません。チームはデータ収集を開始する前に、MIT や Apache 2.0 などのライセンスを評価する必要があります。
データ準備とアノテーション
- Quality and Scale: パフォーマンスは画像品質とトレーニングデータの量に直接結びつきます。
- Flexibility: チームはオープンソース(Tesseract)、商用(Cloud Vision API)、統合型(Donut)など、複数の OCR 手法をテストすべきです。
- Annotation Strategy: アプローチを検証するために数百件の文書から開始し、スケールアップすることが推奨されます。ツールはレイアウトや抽出タスク用のバウンディングボックスをサポートする必要があります。
モデリングと評価
- Fine-tuning vs. Pre-training: Hugging Face は、数百万件の文書と数週間のトレーニングが必要なゼロからの事前学習モデル構築よりも、事前学習済みオープンソースモデルを開始し、ファインチューニングすることを推奨しています。
- Image Resolution: 高解像度の画像は、モデルがより多くのディテールを「見る」ことができるため、性能を向上させます。LayoutLMv2 は画像を 224x224 に縮小しますが、Donut、Pix2Struct、Idefics2 などの新しいモデルは元のアスペクト比と高解像度を維持します。ただし、メモリ要件が増加します。
- Metric Selection: トークン分類や QA では、100% 完全一致よりも部分一致の指標が有用なことが多いです(例:"Acme" と "inside Acme" を一致とみなす)。
人気のある Document AI モデルの概要
| モデル | ライセンス | 主なタスク/アプローチ |
|---|---|---|
| LayoutLM (v1, v2, v3) | MIT / CC BY-NC-SA 4.0 | マルチモーダル / パーシング / 分類 |
| DiT | CC BY-NC-SA 4.0 | ビジョンベースのレイアウト解析 |
| TrOCR | MIT | OCR |
| Table Transformer | MIT | テーブル検出と構造 |
| Donut | MIT | エンドツーエンド(OCR不要)パーシング |
| Pix2Struct | Apache 2.0 | エンドツーエンド / 高解像度 |
| Idefics2 | Apache 2.0 | ビジョン・ランゲージ / エンドツーエンド |
| PaliGemma | PaliGemma | ビジョン・ランゲージ / エンドツーエンド |
Sources
- OriginalAccelerating Document AI