opendatalab/OmniDocBench

[CVPR 2025] A Comprehensive Benchmark for Document Parsing and Evaluation

OmniDocBench – 文件解析模型的基準測試

是什麼 – OmniDocBench 是一個用於衡量 AI 系統解析複雜文件(PDF)能力的 公開資料集 + 評估套件。它涵蓋整個處理流程:版面區塊檢測、文字識別、表格提取、公式讀取以及保持正確的閱讀順序。

為何重要 – 現代多模態模型(如支援 OCR 的視覺-語言模型)通常僅在狹窄任務(如純文字 OCR 或表格檢測)上進行評估。現實世界中的 PDF 混合了多種元素類型、語言和版面。OmniDocBench 提供了一個 單一、豐富標註的基準測試,使研究人員能夠使用統一的指標,對端對端系統和模組化系統在所有這些方面進行比較。

主要特性(如 README 所述)

  • 多樣化內容 – 1,651 頁 PDF,涵蓋 10 類文件(學術論文、財務報告、報紙、教科書、手寫筆記等),5 種版面風格(單欄、雙欄、三欄、混合、其他),以及 5 個語言組(英語、簡體中文、混合等)。
  • 細粒度標註
    • 區塊級:28 個類別(標題、段落、圖表、表格、公式、頁眉/頁腳、程式碼區塊、參考文獻等)。
    • 跨度級:4 個類別(文字行、內嵌公式、腳註標記、忽略的公式)。
    • 每個元素儲存其多邊形座標、閱讀順序索引,以及 識別真值(文字、公式為 LaTeX、表格為 LaTeX + HTML)。
    • 為頁面、表格、文字區塊和公式添加額外屬性標籤(如語言、版面類型、水印、掃描品質、表格邊框、公式類型)。
  • 高品質標註 – 手動篩選、智能預標註、專家與大模型驗證結合。
  • 評估程式碼 – 開源 Python 流水線,支援 端對端模組化(版面檢測、OCR、表格識別、公式識別、閱讀順序)評估。支援多種成熟指標:
    • 文字:歸一化編輯距離、BLEU、METEOR
    • 表格:TEDS、編輯距離
    • 公式:CDM(內容依賴度量)和編輯距離
    • 版面檢測:COCODet 風格的 mAP/mAR
  • 多粒度自適應匹配(MGAM) – 在 v1.6 中引入的匹配演算法,可根據預測粒度自動調整以最小化偏差。
  • 易於部署 – 提供包含可重現環境(Python 3.10、TeX Live 2025、ImageMagick 7、Ghostscript)的 Docker 鏡像,以及基於 Conda 的備用方案。
  • 社群整合 – 支援 EvalScope,可針對任意 OpenAI 相容端點執行該基準測試。

典型工作流程

  1. 準備真值 JSON(README 中所示格式)和模型預測結果,結構一致。
  2. 撰寫設定 YAML,指定每種元素類型的評估指標。
  3. 執行流水線python pdf_validation.py --config …)於 Docker 容器或 Conda 環境中執行。
  4. 檢查結果 – 包括整體得分以及按頁面和屬性的細分結果,幫助定位模型的弱點(如手寫筆記、密集公式、旋轉表格)。

誰會使用它

  • 建構多模態視覺-語言模型、OCR 引擎或專用文件理解系統的研究人員。
  • 需要對其 文件自動化流程(發票處理、學術文獻挖掘、財務報告分析)進行基準測試的企業。
  • 任何希望在論文或產品文件中報告結果時使用 標準化、多語言、多版面測試集 的人。

取得方式

  • 資料集:Hugging Face Hub(opendatalab/OmniDocBench)和 OpenDataLab。
  • 程式碼與文件:本 GitHub 倉儲(opendatalab/OmniDocBench)。
  • 論文:標題中提供的 arXiv 連結。

TL;DR – OmniDocBench 是一個真實、持續維護的基準測試,用於全面評估文件解析,提供大規模、多類型 PDF 資料集,帶有詳細標註和即開即用的評估腳本。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案