ispras/dedoc
Dedoc is a library (service) for automate documents parsing and bringing to a uniform format. It automatically extracts content, logical structure, tables, and meta information from textual electronic documents. (Parse document; Document content extraction; Logical structure extraction; PDF parser; Scanned document parser; DOCX parser; HTML parser
해결하는 문제
Dedoc은 다양한 문서 형식을 통일된 출력 형식으로 변환하는 유니버설 시스템입니다. DOCX, XLSX, HTML, PDF, 이미지 등 반구조적 및 비구조적 데이터에서 논리적 구조(예: 제목, 목록)와 콘텐츠(표, 텍스트 서식, 메타데이터)를 추출하는 문제를 해결합니다.
작동 방식
Dedoc은 전용 라이브러리와 기계학습 기법을 결합하여 다양한 파일 형식을 처리합니다:
- Office 및 웹 형식:
python-docx및BeautifulSoup같은 라이브러리를 사용하여 DOCX, XLSX, HTML의 내부 표현을 분석합니다. - PDF: 복사 가능한 PDF에는
pdfminer-six를 사용하고, 그래픽 인쇄용으로 커스텀 인터프리터를 활용하여 서식을 추출합니다. - 스캔 문서: Tesseract OCR과 OpenCV를 사용해 이미지 전처리를 수행하고, 기계학습 모델로 문서 방향, 컬럼 레이아웃, 굵은 글자 등을 탐지합니다.
- 구조 추출: 입력 형식에 관계없이 문서의 계층적 트리 구조를 자동으로 결정합니다.
대상 사용자
자동 문서 분석 파이프라인, 정보 분석 시스템, 자연어 처리(NLP) 시스템을 구축하는 개발자에게 적합합니다. 이러한 시스템은 추가 분석 전에 구조화된 데이터를 필요로 합니다.
주요 기능
- 유니버설 형식 지원: DOC/DOCX, ODT, XLS/XLSX, CSV, TXT, JSON, PDF, HTML, 이미지(PNG, JPG)를 지원합니다.
- 논리적 구조 추출: 제목과 임의의 레벨의 목록을 포함하는 트리 구조로 문서를 변환합니다.
- 고급 PDF 처리: PDF의 텍스트 레이어 정확성을 자동으로 검증합니다.
- 표 인식: 복잡한 다중 페이지 표(명시적 테두리 포함)를 윤곽 분석을 통해 표 데이터를 추출합니다.
- 확장 가능한 아키텍처: 새로운 문서 형식 추가가 용이하고, 출력 데이터 형식도 유연하게 조정 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트