grobidOrg/grobid

A machine learning software for extracting information from scholarly documents

What it solves

GROBID は、技術・科学系の出版物という、特に構造化されていない PDF 文書から構造化データを抽出する課題を解決するために設計されています。生の PDF を構造化された XML/TEI 形式の文書に変換し、研究者や開発者が書誌情報、全文、引用情報にプログラムからアクセスできるようにします。

How it works

GROBID は「レイアウトトークン」上で動作する一連のシーケンスラベリングモデルを使用します。テキストだけでなく、バウンディングボックスや座標といった視覚的・レイアウト情報も活用できるアプローチです。モデル構造は、速度とスケーラビリティに優れた条件付き確率場(CRF)や、精度の高いディープラーニングモデル(RNN や Transformer)などを選択可能で、JEP 経由で DeLFT ライブラリを利用することが多いです。

Who it’s for

大規模な科学文献コーパスを処理する必要がある開発者や研究者向けです。ResearchGate、Semantic Scholar、Internet Archive Scholar などの主要プラットフォームで、メタデータや全文構造化の自動抽出に利用されています。

Highlights

  • Comprehensive Extraction: ヘッダー(タイトル、著者、所属)、参考文献、引用コンテキスト、全文構造(段落、セクションタイトル、脚注)を抽出。
  • High Performance: 高いスケーラビリティと速度を実現し、1日で数百万ページの処理が可能。
  • Production Ready: 複数の学術・研究機関で大規模本番環境に導入済み。
  • Flexible Deployment: Web サービス API、Docker イメージ、Python、Java、Node.js 用クライアントとして提供。
  • Coordinate Mapping: 抽出情報に PDF 座標を付与し、インタラクティブで拡張可能な PDF の作成を支援。