conjuncts/gmft

Lightweight, performant, deep table extraction

解決的問題

解決從PDF文件中可靠提取表格的困難,這些文件通常缺乏明確的提取方法。特別針對將PDF資料轉換為可用數位格式時,維持表格結構與對齊的挑戰。

工作原理

該工具使用在PubTables-1M資料集上預訓練的Microsoft Table Transformer (TATR)模型,來偵測與識別表格結構。為最大化速度,它預設利用PDF中已有的文字位置資訊,而非依賴OCR。使用PyPDFium2進行高吞吐量文件處理,並可將結果匯出為多種格式,包括Pandas資料框、Markdown、LaTeX、HTML、CSV與JSON。

適用對象

專為需要從科學論文或PDF中提取表格資料的研究人員、資料科學家與開發者設計,提供一種輕量級、高性能的解決方案,可在CPU上執行,無需GPU。

主要亮點

  • 高效率:在CPU上比其他幾種流行的提取工具快約10倍。
  • 輕量級:無需GPU,外部依賴極少(無需Tesseract或Poppler)。
  • 多功能匯出:支援多種輸出格式,並可提供表格的裁剪影像,供GPT-4 Vision等視覺型LLM使用。
  • 高階結構支援:支援隱式表格結構、多欄標題、跨行跨欄單元格以及旋轉表格。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案