yfedoseev/pdf_oxide

The fastest PDF library for Python and Rust. Text extraction, image extraction, markdown conversion, PDF creation & editing. 0.8ms mean, 5× faster than industry leaders, 100% pass rate on 3,830 PDFs. MIT/Apache-2.0.

해결하는 문제

PDFOxide는 기존 PDF 라이브러리의 속도와 라이선스 제약을 해결하기 위해 설계된 고성능 PDF 툴킷입니다. PyMuPDF 같은 라이브러리의 빠른 대안이자 MIT 라이선스를 제공하여 20개 이상의 프로그래밍 언어에서 PDF에서 텍스트, 이미지, 레이아웃을 효율적으로 추출할 수 있게 해줍니다.

작동 방식

이 프로젝트는 최대 성능과 안정성을 위해 Rust로 작성된 핵심 컴포넌트를 사용하며, 안정적인 C ABI를 제공합니다. 이 핵심은 Python, Go, JS/TS, C#, Java, C++ 등 19개의 다른 언어에 대해 자연스러운 바인딩으로 래핑됩니다. 텍스트 추출, 마크다운 변환, 이미지 추출, PDF 편집(예: 폼 필드 채우기)과 같은 다양한 기능을 지원합니다.

대상 사용자

  • AI/LLM 개발자: LLM 소비를 위해 PDF를 깔끔한 마크다운으로 변환해야 하는 RAG(Retrieval-Augmented Generation) 파이프라인을 구축하는 사람들.
  • AI 어시스턴트 사용자: Claude, Cursor 또는 기타 MCP 호환 도구 사용자로서 제공되는 MCP 서버를 통해 로컬 PDF 접근을 원하는 사용자들.
  • 기업 소프트웨어 엔지니어: 대규모 문서 처리를 위해 신뢰할 수 있고, 자유로운 라이선스를 가진 툴킷이 필요한 개발자들.
  • 학술 연구자: 대규모 학술 논문 컬렉션을 분석하는 연구자들.

주요 특징

  • 극한의 속도: 문서당 평균 0.8ms로 벤치마킹되어 PyMuPDF 및 pypdf보다 훨씬 빠릅니다.
  • 광범위한 언어 지원: Rust, Python, Go, WASM 포함 20개 언어에 대한 네이티브 바인딩을 제공합니다.
  • 높은 신뢰성: 실제 3,830개 PDF로 구성된 코퍼스에서 100% 성공률을 기록했습니다.
  • AI 준비 완료: AI 어시스턴트를 위한 전용 MCP 서버와 RAG 파이프라인을 위한 내장된 마크다운 변환 기능을 포함합니다.
  • 자유로운 라이선스: MIT/Apache-2.0 이중 라이선스로 AGPL 제약을 피합니다.

"이 툴킷은 PDF 처리의 미래입니다. 매우 빠르고, 믿을 수 있으며, 모든 언어에서 사용 가능합니다." — @johndoe

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트