opendataloader-project/opendataloader-pdf
PDF Parser for AI-ready data. Automate PDF accessibility. Open-source.
해결하는 문제
OpenDataLoader PDF는 AI 준비형 구조화 데이터로 PDF를 변환하기 위해 설계된 고정확도 PDF 파서입니다. 일반적으로 파싱 과정에서 문서 구조(읽기 순서, 표, 제목 계층 등)를 잃는 문제를 해결하며, 이는 RAG(Retrieval-Augmented Generation) 및 LLM 파이프라인에 매우 중요합니다. 또한 스크린 리더를 위한 PDF 접근성 보정의 높은 비용과 수작업을 줄이기 위해 태그가 지정된 PDF를 자동 생성합니다.
작동 방식
이 도구는 두 가지 주요 처리 모드를 제공합니다:
- 결정론적 로컬 모드: 표준 디지털 PDF에 대해 빠른 자바 기반 처리를 사용합니다.
- 하이브리드 AI 모드: 경계가 없는 표, 스캔된 콘텐츠, 수학 공식을 포함한 복잡한 페이지를 AI 백엔드로 라우팅하여 더 높은 정확도를 제공합니다. 이 모드는 80개 이상의 언어를 지원하는 내장 OCR 기능과 가벼운 비전 모델(SmolVLM)을 사용해 차트 및 이미지에 대한 설명을 생성합니다.
Markdown, JSON(경계 상자 포함), HTML 등의 형식으로 데이터를 추출할 수 있습니다. 접근성 측면에서는 레이아웃 분석과 자동 태깅을 수행하여 태그가 없는 PDF를 태그가 지정된 PDF로 변환합니다.
대상 사용자
- AI 엔지니어: 청크화 및 출처 인용을 위해 깨끗하고 구조화된 Markdown 또는 JSON이 필요한 RAG 파이프라인을 구축하는 사람.
- 접근성 전문가: ADA, EAA 등 글로벌 접근성 규정 준수를 위해 태그가 지정된 PDF를 자동 생성해야 하는 조직.
- 개발자: 복잡한 과학적 또는 다중 열 PDF에서 표, LaTeX 수식, 구조화된 텍스트를 프로그래밍 방식으로 추출해야 하는 사람.
주요 특징
- 벤치마크 리더: 읽기 순서, 표, 제목 분야에서 전체 추출 정확도 0.907로 1위를 기록.
- AI 강화 추출: LaTeX 수식 추출, AI 생성 이미지/차트 설명, 스캔 문서용 OCR 지원.
- 접근성 자동화: Well-Tagged PDF 사양을 따르며, 엔드투엔드로 태그가 지정된 PDF를 생성하는 최초의 오픈소스 도구.
- RAG 준비 출력: 각 요소에 경계 상자 포함 구조화 Markdown 및 JSON을 제공하여 정확한 출처 인용 가능.
- AI 안전성: PDF 레이어에 숨겨진 프롬프트 인젝션 공격을 방지하는 내장 필터 포함.
- 다국어 SDK: Python, Node.js, Java SDK 제공 및 LangChain 통합 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트