Docmatix 数据集发布

Hugging Face 已发布 Docmatix,这是一套用于文档视觉问答(DocVQA)的海量数据集,旨在弥合开源和专有视觉语言模型(VLM)之间的性能差距。在 Docmatix 的一小部分上微调 Florence-2 模型,使其在 DocVQA 基准上相对性能提升近 20%。

数据规模与组成

与之前的 DocVQA 数据集相比,Docmatix 的规模提升了 240 倍。此前用于 Idefics2 等模型的主要数据集包含 10,000 张图像和 39,000 条问答(Q/A)对,而 Docmatix 提供了:

  • 图像: 240 万
  • 问答对: 950 万
  • 来源材料: 130 万份 PDF 文档

生成流水线与质量控制

Docmatix 使用 PDFA OCR 数据集生成,该数据集包含 210 万份 PDF。技术流水线包括以下步骤:

  1. 转录与生成: 来自 PDFA 的转录文本由 Phi-3-small 模型处理,以生成问答对。
  2. 过滤: 为保持数据质量,15% 的生成问答对被视为幻觉而被丢弃。过滤使用正则表达式检测代码,并删除包含关键词 “unanswerable” 的答案。
  3. 图像转换: 将 PDF 转换为分辨率为 150 dpi 的图像,并上传至 Hugging Face Hub,以降低终端用户的转换资源消耗。

提示优化与多样性

为优化数据集,Hugging Face 对首批小规模数据进行消融研究,以改进 Phi-3 模型的提示。优化目标包括:

  • 密度: 目标是每页约四个问答对,以避免重叠(太多)或细节不足(太少)。
  • 类人回答: 确保答案既不过于简短也不过于冗长。
  • 多样性: 通过引导 Phi-3 模型基于文档中的特定信息提问(例如 “What are the titles of John Doe?”),优先实现最小重复。

性能基准

评估使用 Florence-2 模型(7 亿参数)进行。比较了两种 Florence-2 版本:一种在标准 DocVQA 数据集上微调,另一种在 Docmatix 的子集(20% 图像和 4% 问答对)上微调后,再在 DocVQA 上进行一次 epoch 的格式化微调。

数据集 DocVQA 上的 ANSL 模型大小
Florence-2 在 DocVQA 上微调 60.1 700M
Florence-2 在 Docmatix 上微调 71.4 700M
Idefics2 74.0 8B

结果表明,使用 Docmatix 微调的 7 亿参数 Florence-2 模型仅比 80 亿参数的 Idefics2 模型差 5%,展示了大规模数据集的高效性。

Sources