conjuncts/gmft

Lightweight, performant, deep table extraction

何を解決するか

PDFドキュメントからテーブルを信頼性高く抽出する困難を解決します。PDFには明確な抽出方法がなく、通常は構造と整合性を維持したままデジタル形式に変換するのが難しいです。

動作方法

このツールは、PubTables-1Mデータセットで事前学習されたMicrosoftのTable Transformer (TATR)モデルを使用して、テーブル構造を検出・認識します。高速化のために、デフォルトではOCRに頼らず、PDF内の既存のテキスト位置情報を活用します。PyPDFium2を用いて高スループットのドキュメント処理を実現し、Pandasデータフレーム、Markdown、LaTeX、HTML、CSV、JSONなど、さまざまなフォーマットにエクスポート可能です。

対象ユーザー

科学論文やPDFから表形式データを抽出する必要がある研究者、データサイエンティスト、開発者向けです。CPU上で動作する軽量で高性能なソリューションを必要とする方々に最適です。GPUは不要です。

特徴

  • 高パフォーマンス: 他の人気ある抽出ツールと比較して、CPU上で約10倍高速です。
  • 軽量: GPU不要、外部依存性も最小限(TesseractやPopplerの導入は不要)。
  • 多様なエクスポート: 複数の出力フォーマットをサポートし、GPT-4 Visionなどの視覚ベースのLLMで使用可能なテーブルのクロップ画像も提供可能。
  • 高度な構造対応: 隠れたテーブル構造、複数カラムヘッダー、セルの結合、回転したテーブルをすべて対応。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト