grobidOrg/grobid
A machine learning software for extracting information from scholarly documents
What it solves
GROBID 旨在解决从原始、非结构化 PDF 文档中提取结构化数据的问题,特别针对技术和科学出版物。它将原始 PDF 转换为结构化的 XML/TEI 编码文档,让研究人员和开发者能够以编程方式访问书目信息、全文和引用。
How it works
GROBID 使用一系列序列标注模型,这些模型作用于“布局标记”而非原始文本。此方法使系统能够利用视觉和布局信息(如边框和坐标)以及文本本身。它可以采用多种模型架构,包括速度和可扩展性好的条件随机场(CRF),或是精度更高的深度学习模型(RNN 或 transformer),通常通过 JEP 使用 DeLFT 库。
Who it’s for
它面向需要处理大规模科学文献语料库的开发者和研究者。已被 ResearchGate、Semantic Scholar 和 Internet Archive Scholar 等主要平台使用,以自动化提取元数据和全文结构化。
Highlights
- Comprehensive Extraction: 提取标题、作者、机构等头部信息、参考文献、引用上下文以及全文结构(段落、章节标题、脚注)。
- High Performance: 为高可扩展性和高速设计,能够每日处理数百万页。
- Production Ready: 已在多个学术和研究机构的大规模生产环境中部署。
- Flexible Deployment: 通过 Web 服务 API、Docker 镜像以及 Python、Java、Node.js 客户端提供。
- Coordinate Mapping: 为提取的信息提供 PDF 坐标,便于创建交互式、增强型 PDF。