oomol-lab/pdf-craft

PDF craft can convert PDF files into various other formats. This project will focus on processing PDF files of scanned books.

해결하는 문제

pdf-craft는 스캔된 PDF를 포함한 PDF를 검색 가능하고 편집 가능한 형식인 Markdown 또는 EPUB로 변환하기 위한 변환 라이브러리입니다. 특히 책, 학술 논문, 기술 문서를 대상으로 하며 목차, 각주, 표, 수식, 이미지와 같은 복잡한 요소를 처리합니다.

작동 방식

이 라이브러리는 페이지 이미지를 텍스트로 변환하기 위해 OCR(광학 문자 인식) 파이프라인을 사용합니다. DeepSeek OCR 및 Baidu의 무제한 OCR과 같은 여러 OCR 백엔드를 지원하며, NVIDIA GPU(CUDA를 통해)에서 로컬로 실행하거나 원격 공급업체 서비스를 통해 실행할 수 있습니다. 번역을 위해 별도의 텍스트 LLM을 통합하여 변환 중에 콘텐츠를 번역하거나 기존 EPUB을 번역할 수 있습니다. 또한 번역된 텍스트를 원본 PDF 레이아웃에 다시 쓰는 "PDF에서 PDF로의 번역"도 가능합니다.

대상 사용자

스캔된 PDF에서 텍스트를 추출하거나, 추가 처리 또는 다른 언어로 번역하기 위해 구조화되고 편집 가능한 형식으로 변환해야 하는 연구자, 학생, 개발자.

주요 기능

  • 유연한 OCR 백엔드: 로컬 GPU 실행과 원격 API 기반 OCR 모두 지원.
  • 다양한 형식 출력: PDF를 Markdown, EPUB, 또는 번역된 PDF로 변환 가능.
  • LLM 기반 번역: 변환 과정 중 콘텐츠를 번역하기 위해 텍스트 LLM과 통합.
  • 복잡한 문서 처리: 수식과 표를 포함한 학술 및 기술 문서에 특별히 최적화.
  • EPUB 번역: 기존 EPUB 파일을 번역할 수 있으며, 원본 텍스트를 대체하거나 번역본을 추가할 수 있는 옵션 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트