mindee/doctr

docTR (Document Text Recognition) - a seamless, high-performing & accessible library for OCR-related tasks powered by Deep Learning. Ongoing development and maintenance by t2k.

해결하는 문제

docTR는 문서에서 광학 문자 인식(OCR)을 수행하는 시ーム리스하고 접근하기 쉬운 방법을 제공합니다. PDF, 이미지, 또는 웹페이지에서 단어의 위치를 식별하고 문자를 인식함으로써 텍스트 정보를 추출하여 시각적 문서 데이터를 기계가 읽을 수 있는 텍스트로 변환합니다.

작동 방식

이 라이브러리는 엔드투엔드 OCR을 위한 두 단계 접근 방식을 사용합니다:

  1. 텍스트 검출: DBNet, LinkNet, FAST와 같은 아키텍처를 사용하여 페이지 상의 단어 위치를 식별합니다.
  2. 텍스트 인식: CRNN, SAR, MASTER, ViTSTR, PARSeq, VIPTR와 같은 아키텍처를 사용하여 식별된 단어 내 문자를 인식합니다.

또한 특정 정보 클래스(예: 날짜, 주소)를 검출하는 KIE(Key Information Extraction) 예측기와 제목, 표, 풋터와 같은 영역을 식별하는 레이아웃 검출 모델도 제공합니다.

대상 사용자

간단한 스크립트 기반 분석부터 FastAPI를 사용한 완전한 API 배포까지, 고품질 OCR 및 문서 분석 기능을 애플리케이션에 통합하고자 하는 개발자 및 조직을 위한 것입니다.

주요 특징

  • 유연한 아키텍처: 검출 및 인식에 대해 여러 사전 학습된 모델을 지원합니다.
  • 다양한 입력 형식: PDF, 이미지, URL을 처리할 수 있습니다.
  • 문서 구조: Page, Block, Line, Word로 구성된 중첩된 객체 구조를 반환하며, JSON으로 내보낼 수 있습니다.
  • 레이아웃 및 표 분석: 문서 레이아웃 영역과 표 구조를 검출하는 기능을 포함합니다.
  • 배포 준비 완료: Docker 이미지와 FastAPI 템플릿을 제공하여 빠른 API 통합이 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트