deepdoctection/deepdoctection
A Repo For Document AI
해결하는 문제
Deepdoctection은 문서 이해라는 복잡한 작업을 처리하도록 설계되었습니다. 레이아웃 분석, OCR 및 분류를 위한 다양한 AI 모델을 오케스트레이션하여 비구조화된 스캔 또는 PDF 문서를 구조화된 데이터로 변환하는 문제를 해결합니다.
작동 방식
이 라이브러리는 문서 추출을 위한 파이프라인을 구축하는 오케스트레이션 계층 역할을 합니다. 다음과 같은 여러 전문 도구 및 모델을 통합합니다:
- 레이아웃 분석 및 표 인식: PyTorch와 Detectron2 및 Transformers를 사용합니다.
- OCR: Tesseract, DocTr 및 AWS Textract를 지원합니다.
- 문서 및 토큰 분류: LayoutLM 제품군, LiLT 및 Bert 스타일 모델을 채택합니다.
- 텍스트 마이닝: 네이티브 PDF의 경우 pdfplumber를 사용합니다.
- 전처리: jdeskew 또는 Tesseract를 통한 이미지 왜곡 보정 및 회전을 포함합니다.
- 언어 감지: 언어 식별을 위해 Transformer 기반 모델을 사용합니다.
대상 사용자
자동화된 문서 처리 워크플로우를 구축하거나, PDF 및 스캔 데이터에서 구조화된 정보를 추출하거나, 특정 작업을 위해 사전 학습된 문서 AI 모델을 미세 조정해야 하는 개발자 및 데이터 과학자.
주요 특징
- 모듈형 파이프라인: 여러 OCR 및 레이아웃 분석 도구를 단일 워크플로우로 오케스트레이션합니다.
- 폭넓은 모델 지원: LayoutLM, BERT, RoBERTa와 같은 모델을 위해 Hugging Face Hub와 통합됩니다.
- PyTorch 전용: 최근의 리팩토링을 통해 딥러닝 모델 전반에 걸쳐 일관된 지원을 보장합니다.
- 미세 조정 기능: 사용자가 객체 탐지 및 분류 모델을 미세 조정하고 결과 파이프라인을 평가할 수 있도록 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트