conjuncts/gmft

Lightweight, performant, deep table extraction

解决的问题

解决了从PDF文档中可靠提取表格的难题,这类文档通常缺乏明确的提取方法。特别针对将PDF数据转换为可用数字格式时保持表格结构和对齐的挑战。

工作原理

该工具使用在PubTables-1M数据集上预训练的Microsoft Table Transformer (TATR)模型来检测和识别表格结构。为最大化速度,它默认利用PDF中已有的文本位置信息,而非依赖OCR。它使用PyPDFium2进行高吞吐量文档处理,并可将结果导出为多种格式,包括Pandas数据框、Markdown、LaTeX、HTML、CSV和JSON。

适用人群

专为需要从科学论文或PDF中提取表格数据的研究人员、数据科学家和开发者设计,提供一种轻量级、高性能的解决方案,可在CPU上运行,无需GPU。

主要亮点

  • 高性能:在CPU上比其他几种流行的提取工具快约10倍。
  • 轻量级:无需GPU,外部依赖极少(无需Tesseract或Poppler)。
  • 多功能导出:支持多种输出格式,并可提供表格的裁剪图像,供GPT-4 Vision等基于视觉的LLM使用。
  • 高级结构支持:支持隐式表格结构、多列标题、跨行跨列单元格以及旋转表格。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目