opendataloader-project/opendataloader-pdf
PDF Parser for AI-ready data. Automate PDF accessibility. Open-source.
What it solves
OpenDataLoader PDF는 고정밀 PDF 파서로, PDF를 AI 및 LLM 파이프라인(예: RAG)에서 사용할 구조화된 데이터로 변환함과 동시에 접근성 및 스크린리더 호환 Tagged PDF를 자동으로 생성하여 수동 접근성 보정 비용을 크게 낮춥니다.
How it works
이 도구는 두 가지 주요 처리 모드를 제공합니다:
- Deterministic Local Mode: 빠른 Java 기반 처리를 사용해 표준 디지털 PDF에서 텍스트, 헤딩, 간단한 표를 고속으로 추출합니다.
- Hybrid AI Mode: 테두리 없는 표, LaTeX 수식, 스캔 이미지 등 복잡한 페이지를 AI 백엔드로 라우팅해 정확도를 높입니다. 이 모드에는 80개 이상의 언어를 지원하는 OCR이 내장되어 있으며, 경량 비전 모델(SmolVLM)을 사용해 차트와 이미지에 대한 설명을 생성합니다.
접근성을 위해 레이아웃 분석 및 자동 태깅을 수행하여 Well‑Tagged PDF 사양에 따라 태그가 없는 PDF를 Tagged PDF로 변환합니다.
Who it’s for
- AI Engineers: RAG 파이프라인을 구축하고, 소스 인용을 위한 바운딩 박스가 포함된 깔끔한 Markdown 또는 JSON이 필요한 엔지니어.
- Accessibility Specialists: 태그가 없는 PDF를 자동으로 접근 가능한 형식으로 변환하여 ADA, EAA 등 글로벌 규정을 준수해야 하는 조직.
- Developers: Python, Node.js, Java SDK를 사용해 PDF 파싱을 애플리케이션에 통합하려는 개발자.
Highlights
- Benchmark Leader: 읽기 순서, 표, 헤딩 전체 추출 정확도(0.907)에서 1위.
- Multi-Format Output: Markdown, JSON(바운딩 박스 포함), HTML, Tagged PDF로 내보내기 지원.
- AI-Enhanced Extraction: LaTeX 수식 추출 및 이미지·차트에 대한 AI 생성 설명 지원.
- AI Safety: PDF 레이어에 숨겨진 프롬프트 인젝션 공격을 방지하는 필터 포함.
- Open Source Core: 레이아웃 분석 및 자동 태깅 기능을 Apache 2.0 라이선스로 제공.