huridocs/pdf-document-layout-analysis
A Docker-powered service for PDF document layout analysis. This service provides a powerful and flexible PDF analysis service. The service allows for the segmentation and classification of different parts of PDF pages, identifying the elements such as texts, titles, pictures, tables and so on.
해결하는 문제
이 프로젝트는 지능형 PDF 레이아웃 분석을 위한 마이크로 서비스를 제공하여, 사용자가 복잡한 PDF 문서를 Markdown이나 HTML과 같은 구조화된 형식으로 변환할 수 있게 합니다. 이 과정에서 읽기 순서를 유지하고 제목, 표, 수식과 같은 특정 콘텐츠 유형을 식별합니다.
작동 방식
이 서비스는 머신러닝 모델을 결합하여 PDF 콘텐츠를 세그먼트화하고 분류합니다. 높은 정확도를 위한 Vision Grid Transformer (VGT)와 빠른 처리를 위한 LightGBM 중 선택할 수 있습니다. Tesseract OCR을 통합하여 150개 이상의 언어를 지원하며, Ollama 기반 모델을 사용하여 추출된 콘텐츠를 여러 대상 언어로 자동 번역합니다.
대상 사용자
PDF에서 구조화된 데이터를 프로그래밍 방식으로 추출해야 하는 개발자 및 조직은 물론, Gradio 웹 UI를 통한 문서 변환 및 번역을 선호하는 사용자를 위해 설계되었습니다.
주요 특징
- 멀티 모델 분석: 고정밀 VGT 또는 고속 LightGBM 모델 중 선택 가능.
- 구조화된 내보내기: PDF를 Markdown 또는 HTML로 변환하며, 수식은 LaTeX, 표는 HTML로 처리.
- 통합 번역: Ollama 모델을 사용한 자동 문서 번역으로 서식 유지.
- 포괄적인 도구: REST API, Gradio 웹 인터페이스, GPU 가속을 지원하는 Docker 포함.
- OCR 기능: 150개 이상의 언어를 지원하며 페이지 회전 및 기울기 보정 기능 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트