grobidOrg/grobid
A machine learning software for extracting information from scholarly documents
What it solves
GROBID는 기술 및 과학 출판물과 같이 원시 비구조화 PDF 문서에서 구조화된 데이터를 추출하는 문제를 해결하도록 설계되었습니다. 원시 PDF를 구조화된 XML/TEI 인코딩 문서로 변환하여 연구자와 개발자가 서지 정보, 전체 텍스트 및 인용 정보를 프로그래밍 방식으로 접근할 수 있게 합니다.
How it works
GROBID는 "레이아웃 토큰"을 기반으로 동작하는 일련의 시퀀스 라벨링 모델을 사용합니다. 이 접근 방식은 텍스트와 함께 바운딩 박스와 좌표와 같은 시각·레이아웃 정보를 활용할 수 있게 합니다. 모델 아키텍처는 속도와 확장성이 뛰어난 조건부 랜덤 필드(CRF) 또는 높은 정확도를 제공하는 딥러닝 모델(RNN 또는 Transformer) 등을 선택할 수 있으며, 보통 JEP을 통해 DeLFT 라이브러리를 사용합니다.
Who it’s for
대규모 과학 문헌 코퍼스를 처리해야 하는 개발자와 연구자를 위한 도구입니다. ResearchGate, Semantic Scholar, Internet Archive Scholar 등 주요 플랫폼에서 메타데이터와 전체 텍스트 구조화를 자동화하는 데 사용되고 있습니다.
Highlights
- Comprehensive Extraction: 헤더(제목, 저자, 소속), 참고문헌, 인용 컨텍스트 및 전체 텍스트 구조(단락, 섹션 제목, 각주)를 추출합니다.
- High Performance: 높은 확장성과 속도를 위해 설계되어 하루에 수백만 페이지를 처리할 수 있습니다.
- Production Ready: 여러 학술·연구 기관의 대규모 프로덕션 환경에 배포되어 있습니다.
- Flexible Deployment: 웹 서비스 API, Docker 이미지, Python, Java, Node.js 클라이언트 형태로 제공됩니다.
- Coordinate Mapping: 추출된 정보에 PDF 좌표를 제공하여 인터랙티브하고 증강된 PDF를 만들 수 있게 합니다.