jerryjliu/docjev

A very fast document classifier/splitter using Jev

해결하는 문제

DocJev는 자연어 규칙을 기반으로 문서를 자동으로 분류하고 대용량 PDF 패킷을 개별 문서로 분할하는 방법을 제공합니다. 이는 여러 재무 보고서가 결합된 PDF와 같은 다중 페이지 파일을 수동으로 정렬하고, 인접한 문서가 동일한 범주에 속하더라도 문서의 시작과 끝을 식별해야 하는 문제를 해결합니다.

작동 방식

이 시스템은 OCR과 의사 결정 엔진 파이프라인을 사용합니다. LiteParse(로컬) 또는 LlamaParse(복잡한 레이아웃을 위한 클라우드 기반 OCR)를 사용하여 PDF, DOCX 또는 PPTX 파일에서 텍스트를 추출합니다. 이 텍스트는 Jev 의사 결정 엔진(호스팅 서비스)으로 전송되며, 자연어 범주 규칙을 적용하여 문서의 범주나 페이지 간 경계를 예측합니다. 이 프로세스는 페이지 단위로 연속적으로 수행되므로 각 세그먼트의 페이지 범위를 식별합니다.

대상 사용자

세금 양식, 보도 자료, 재무 보고서와 같은 문서가 자주 묶여서 제공되는 금융, 정부 또는 법률 분야와 같이 대량의 비정형 문서 패킷을 처리해야 하는 사용자 및 개발자를 위해 설계되었습니다.

주요 특징

  • 다중 형식 지원: PDF, DOCX 및 PPTX 파일을 처리합니다.
  • 유연한 규칙: YAML 기반의 자연어 설명을 사용하여 범주와 분할 로직을 정의합니다.
  • 하이브리드 OCR: LiteParse를 통한 로컬 파싱과 LlamaParse를 통한 선택적 클라우드 기반 OCR을 제공합니다.
  • 검토 플래그: 불확실한 경계나 범주 충돌을 자동으로 플래그 지정하여 사람이 검토할 수 있도록 합니다.
  • 성능 벤치마크: GPT-5.6 Luna와 같은 다른 모델과 비교한 의사 결정 지연 시간 및 정확도에 대한 상세한 비교를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트