grobidOrg/grobid
A machine learning software for extracting information from scholarly documents
What it solves
GROBID 旨在解決從原始、非結構化 PDF 文件中提取結構化資料的問題,特別針對技術與科學出版物。它將原始 PDF 轉換為結構化的 XML/TEI 編碼文件,讓研究人員與開發者能以程式方式存取書目資訊、全文與引用。
How it works
GROBID 使用一系列序列標記模型,這些模型作用於「版面標記」而非純文字。此方法允許系統同時利用視覺與版面資訊(如邊框與座標)以及文字本身。它可以採用多種模型架構,包括速度與可擴展性佳的條件隨機場(CRF),或是精度更高的深度學習模型(RNN 或 transformer),常透過 JEP 使用 DeLFT 函式庫。
Who it’s for
此工具適合需要處理大規模科學文獻語料庫的開發者與研究者。它已被 ResearchGate、Semantic Scholar 與 Internet Archive Scholar 等主要平台使用,以自動化擷取中繼資料與全文結構化。
Highlights
- Comprehensive Extraction: 提取標題、作者、所屬機構等標頭資訊、參考文獻、引用上下文與全文結構(段落、章節標題、腳註)。
- High Performance: 為高可擴展性與高速設計,能每日處理數百萬頁。
- Production Ready: 已在多所學術與研究機構的大規模生產環境中部署。
- Flexible Deployment: 透過 Web 服務 API、Docker 映像,以及 Python、Java、Node.js 客戶端提供。
- Coordinate Mapping: 為抽取資訊提供 PDF 座標,方便建立互動式、增強型 PDF。