Hugging Face 加速文档 AI
Hugging Face 详细阐述了一个加速文档 AI 的框架,使企业能够利用开源多模态模型解锁发票、报告、表单等非数字化文档中被封存的知识。由仅文本模型向视觉语言模型的转变,通过结合视觉布局和结构与文本,实现了显著更高的准确率。
文档 AI 用例分类
文档 AI 包含多个不同的数据科学任务,范围从基础的文本转换到复杂的视觉推理。
光学字符识别 (OCR)
OCR 将打字、手写或印刷的文本转换为机器可读的文本,是许多文档 AI 工作流的核心。
- 关键模型: EasyOCR、PaddleOCR 和 TrOCR(在单行文本图像上运行,通常与检测模型如 CRAFT 配合使用)。
- 评估指标: 字符错误率(CER)以及词级别的精确率、召回率和 F1。
文档图像分类
该任务通过图像、文本或两者结合对文档进行分类(例如,将文档标记为发票或信件)。结合视觉结构和文本的多模态模型显著优于仅文本模型。
- 性能对比: 在 RVL‑CDIP 基准上,BERT‑base(仅文本)达到 89% 的准确率,Document Image Transformer(DiT,仅视觉)达到 92%,而 LayoutLMv3 和 Donut 等多模态模型可达 95%。
文档布局分析
布局分析识别文档的物理结构,如标题、表格和文本段落,通常被视为目标检测问题。
- 关键模型: LayoutLMv3 和 DiT(均使用 Mask R‑CNN 作为骨干网络)。
- 基准: LayoutLMv3 在 PubLayNet 数据集上实现了整体 mAP(平均精度)为 0.951。
文档解析
解析从文档中提取特定的键值对(例如,发票中的名称和总额)。
- 模型演进: LayoutLM 系列(v1、v2、v3)带来了性能的跨越式提升;例如,在 FUNSD 基准上,LayoutLM 的 F1 分数可达 90%,而 BERT 仅为 60%。
- 端到端方法: 新的生成模型如 Donut、Pix2Struct、UDOP,以及更大的视觉语言模型(LLaVa‑NeXT、Idefics2 和 PaliGemma)能够以端到端(图像到文本)的方式进行解析,无需单独的 OCR 引擎。
表格检测与提取
该任务包括定位表格、识别结构(行、列、单元格)以及进行功能分析(识别键和值)。
- 关键模型: Table Transformer(类似 DETR 的模型,基于 PubTables‑1M 训练)。
- 性能: Table Transformer 在 PubTables‑1M 上报告表格检测的 AP 为 0.966,结构识别与功能分析的 AP 为 0.912。
文档视觉问答 (DocVQA)
DocVQA 让用户能够针对文档图像提问并获得文本答案。
- 关键模型: LayoutLMv3(OCR + 多模态 Transformer)在 DocVQA 基准上获得 83.37 的 ANLS 分数。端到端模型如 Donut、LLaVa‑NeXT 和 Idefics2 则无需 OCR。
- 风险: DocVQA 模型可能出现幻觉(给出文档中不存在的答案),并可能继承训练数据中的偏见。
企业实施考虑因素
许可与商业使用
许可是企业采用的关键因素。部分高性能模型的许可证受限。例如,Microsoft 的 LayoutLMv2 和 LayoutLMv3 检查点不允许商业使用。团队在开始数据收集前必须评估许可证(如 MIT、Apache 2.0)。
数据准备与标注
- 质量与规模: 性能直接受图像质量和训练数据量的影响。
- 灵活性: 团队应测试多种 OCR 方法,包括开源(Tesseract)、商业(Cloud Vision API)或集成式(Donut)。
- 标注策略: 建议先使用几百份文档验证方法,再进行规模化。工具需支持布局和提取任务的边界框。
建模与评估
- 微调 vs. 预训练: Hugging Face 建议使用预训练的开源模型并进行微调,因为从头构建预训练模型需要数百万文档和数周训练。
- 图像分辨率: 更高分辨率的图像提升性能,使模型能够“看到”更多细节。LayoutLMv2 将图像下采样至 224×224,而 Donut、Pix2Struct、Idefics2 等新模型保持原始宽高比和高分辨率,虽会增加内存需求。
- 指标选择: 对于 token 分类或 QA,部分匹配指标往往比 100% 完全匹配更有用(例如,将 “Acme” 与 “inside Acme” 视为匹配)。
流行文档 AI 模型概览
| 模型 | 许可证 | 主要任务/方法 |
|---|---|---|
| LayoutLM (v1, v2, v3) | MIT / CC BY-NC-SA 4.0 | 多模态 / 解析 / 分类 |
| DiT | CC BY-NC-SA 4.0 | 基于视觉的布局分析 |
| TrOCR | MIT | OCR |
| Table Transformer | MIT | 表格检测与结构 |
| Donut | MIT | 端到端(无 OCR)解析 |
| Pix2Struct | Apache 2.0 | 端到端 / 高分辨率 |
| Idefics2 | Apache 2.0 | 视觉语言 / 端到端 |
| PaliGemma | PaliGemma | 视觉语言 / 端到端 |
Sources
- OriginalAccelerating Document AI