conjuncts/gmft
Lightweight, performant, deep table extraction
解决的问题
解决了从PDF文档中可靠提取表格的难题,这类文档通常缺乏明确的提取方法。特别针对将PDF数据转换为可用数字格式时保持表格结构和对齐的挑战。
工作原理
该工具使用在PubTables-1M数据集上预训练的Microsoft Table Transformer (TATR)模型来检测和识别表格结构。为最大化速度,它默认利用PDF中已有的文本位置信息,而非依赖OCR。它使用PyPDFium2进行高吞吐量文档处理,并可将结果导出为多种格式,包括Pandas数据框、Markdown、LaTeX、HTML、CSV和JSON。
适用人群
专为需要从科学论文或PDF中提取表格数据的研究人员、数据科学家和开发者设计,提供一种轻量级、高性能的解决方案,可在CPU上运行,无需GPU。
主要亮点
- 高性能:在CPU上比其他几种流行的提取工具快约10倍。
- 轻量级:无需GPU,外部依赖极少(无需Tesseract或Poppler)。
- 多功能导出:支持多种输出格式,并可提供表格的裁剪图像,供GPT-4 Vision等基于视觉的LLM使用。
- 高级结构支持:支持隐式表格结构、多列标题、跨行跨列单元格以及旋转表格。
相关
- 项目
- 项目
- 项目
- 项目
- 项目