opendatalab/OmniDocBench

[CVPR 2025] A Comprehensive Benchmark for Document Parsing and Evaluation

OmniDocBench – 文档解析模型的基准测试

是什么 – OmniDocBench 是一个用于衡量 AI 系统解析复杂文档(PDF)能力的 公开数据集 + 评估套件。它覆盖整个处理流程:布局块检测、文本识别、表格提取、公式读取以及保持正确的阅读顺序。

为何重要 – 现代多模态模型(如支持 OCR 的视觉-语言模型)通常仅在狭窄任务(如纯文本 OCR 或表格检测)上进行评估。现实世界中的 PDF 混合了多种元素类型、语言和布局。OmniDocBench 提供了一个 单一、丰富标注的基准测试,使研究人员能够使用统一的指标,对端到端系统和模块化系统在所有这些方面进行比较。

主要特性(如 README 所述)

  • 多样化内容 – 1,651 页 PDF,涵盖 10 类文档(学术论文、财务报告、报纸、教科书、手写笔记等),5 种布局风格(单栏、双栏、三栏、混合、其他),以及 5 个语言组(英语、简体中文、混合等)。
  • 细粒度标注
    • 块级:28 个类别(标题、段落、图表、表格、公式、页眉/页脚、代码块、参考文献等)。
    • 跨度级:4 个类别(文本行、内联公式、脚注标记、忽略的公式)。
    • 每个元素存储其多边形坐标、阅读顺序索引,以及 识别真值(文本、公式为 LaTeX、表格为 LaTeX + HTML)。
    • 为页面、表格、文本块和公式添加额外属性标签(如语言、布局类型、水印、扫描质量、表格边框、公式类型)。
  • 高标注质量 – 手动筛选、智能预标注、专家与大模型验证相结合。
  • 评估代码 – 开源 Python 流水线,支持 端到端模块化(布局检测、OCR、表格识别、公式识别、阅读顺序)评估。支持多种成熟指标:
    • 文本:归一化编辑距离、BLEU、METEOR
    • 表格:TEDS、编辑距离
    • 公式:CDM(内容依赖度量)和编辑距离
    • 布局检测:COCODet 风格的 mAP/mAR
  • 多粒度自适应匹配(MGAM) – 在 v1.6 中引入的匹配算法,可根据预测粒度自动调整以最小化偏差。
  • 易于部署 – 提供包含可复现环境(Python 3.10、TeX Live 2025、ImageMagick 7、Ghostscript)的 Docker 镜像,以及基于 Conda 的备用方案。
  • 社区集成 – 支持 EvalScope,可针对任意 OpenAI 兼容端点运行该基准测试。

典型工作流程

  1. 准备真值 JSON(README 中所示格式)和模型预测结果,结构一致。
  2. 编写配置 YAML,指定每种元素类型的评估指标。
  3. 运行流水线python pdf_validation.py --config …)在 Docker 容器或 Conda 环境中执行。
  4. 检查结果 – 包括总体得分以及按页面和属性的细分结果,帮助定位模型的薄弱环节(如手写笔记、密集公式、旋转表格)。

谁会使用它

  • 构建多模态视觉-语言模型、OCR 引擎或专用文档理解系统的研究人员。
  • 需要对其 文档自动化流水线(发票处理、学术文献挖掘、财务报告分析)进行基准测试的企业。
  • 任何希望在论文或产品文档中报告结果时使用 标准化、多语言、多布局测试集 的人。

获取方式

  • 数据集:Hugging Face Hub(opendatalab/OmniDocBench)和 OpenDataLab。
  • 代码与文档:本 GitHub 仓库(opendatalab/OmniDocBench)。
  • 论文:标题中提供的 arXiv 链接。

TL;DR – OmniDocBench 是一个真实、持续维护的基准测试,用于全面评估文档解析,提供大规模、多类型 PDF 数据集,带有详细标注和即开即用的评估脚本。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目