opendatalab/OmniDocBench

[CVPR 2025] A Comprehensive Benchmark for Document Parsing and Evaluation

OmniDocBench – ドキュメント解析モデル用のベンチマーク

何であるか – OmniDocBench は、AIシステムが複雑なドキュメント(PDF)をどれだけ正確に解析できるかを測定するための公開データセット + 評価スイートです。レイアウトブロックの検出、テキスト認識、テーブル抽出、数式の読み取り、正しい読み順の維持といった、全体のパイプラインを対象としています。

なぜ重要か – 現代のマルチモーダルモデル(例:OCR対応の視覚言語モデル)は、通常、単純なテキストOCRやテーブル検出といった狭いタスクで評価されます。実世界のPDFは、多くの要素タイプ、言語、レイアウトが混在しています。OmniDocBenchは、研究者が一貫したメトリクスで、エンドツーエンドシステムとモジュール単位の両方で、これらのすべての側面を比較できる単一で豊富にアノテーションされたベンチマークを提供します。

主な特徴(READMEに記載)

  • 多様なコンテンツ – 1,651ページのPDF(10種類のドキュメントカテゴリ:学術論文、財務報告書、新聞、教科書、手書きメモなど)、5種類のレイアウトスタイル(単一、二段、三段、混合、その他)、5言語グループ(英語、簡体中国語、混合、…)
  • 細粒度のアノテーション
    • ブロックレベル:28カテゴリ(見出し、段落、図、表、数式、ヘッダー/フッター、コードブロック、参考文献、…)
    • スパンレベル:4カテゴリ(テキスト行、インライン数式、脚注マーク、無視された数式)
    • 各要素にはポリゴン座標、読み順インデックス、および認識の正解ラベル(テキスト、数式はLaTeX、表はLaTeX + HTML)が保存されます。
    • ページ、表、テキストブロック、数式に追加の属性タグ(例:言語、レイアウトタイプ、透かし、スキャン品質、表の罫線、数式タイプ)
  • 高品質なアノテーション – 手動スクリーニング、知能的な事前アノテーション、専門家と大規模モデルによる検証の組み合わせ
  • 評価コード – オープンソースのPythonパイプラインで、エンドツーエンドまたはモジュール単位(レイアウト検出、OCR、テーブル認識、数式認識、読み順)の評価が可能。複数の既存メトリクスをサポート:
    • テキスト:正規化編集距離、BLEU、METEOR
    • テーブル:TEDS、編集距離
    • 数式:CDM(コンテンツ依存メトリクス)と編集距離
    • レイアウト検出:COCODetスタイルのmAP/mAR
  • 多粒度適応マッチング(MGAM) – v1.6で導入された、予測の粒度を調整してバイアスを最小化するマッチングアルゴリズム
  • 簡単なデプロイ – 再現可能な環境(Python 3.10、TeX Live 2025、ImageMagick 7、Ghostscript)を備えたDockerイメージと、Condaベースのバックアップ
  • コミュニティ統合 – OpenAI互換エンドポイントに対してベンチマークを実行できるEvalScopeサポート

一般的なワークフロー

  1. 正解JSONの準備(READMEに示す形式)と、モデルの予測を同じ構造で用意。
  2. 各要素タイプの評価に使用するメトリクスを指定する設定YAMLファイルを作成。
  3. DockerコンテナまたはConda環境内でパイプラインを実行(python pdf_validation.py --config …)。
  4. 結果を確認 – 全体スコアに加え、ページ単位・属性単位の分解結果を確認でき、モデルの弱点(例:手書きメモ、密集した数式、回転した表)を特定できます。

誰が使うか

  • マルチモーダル視覚言語モデル、OCRエンジン、専用ドキュメント理解システムを開発する研究者
  • ドキュメント自動化パイプラインをベンチマークしたい企業(請求書処理、学術文献マイニング、財務報告分析)
  • 論文や製品ドキュメントで結果を報告するための標準化された、多言語・多レイアウトのテストセットが必要な人

入手先

  • データセット:Hugging Face Hub(opendatalab/OmniDocBench)およびOpenDataLab
  • コード&ドキュメント:このGitHubリポジトリ(opendatalab/OmniDocBench
  • 論文:ヘッダーに記載のarXivリンク

TL;DR – OmniDocBenchは、包括的なドキュメント解析評価のための本格的で、積極的にメンテナンスされているベンチマークであり、詳細なアノテーション付きの大規模な多様なPDFデータセットと、即時実行可能な評価スクリプトを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト