enoch3712/ExtractThinker
ExtractThinker is a Document Intelligence library for LLMs, offering ORM-style interaction for flexible and powerful document workflows.
해결하는 문제
ExtractThinker는 비정형 문서(PDF, 이미지, 스프레드시트 등)를 구조화되고 검증된 Python 객체로 변환하는 과정을 간소화합니다. 사용자가 Pydantic 계약을 사용하여 원하는 데이터 스키마를 정의할 수 있게 함으로써 복잡한 파싱 로직을 수동으로 작성하는 수고를 덜어줍니다.
작동 방식
이 라이브러리는 문서 로더, LLM, 그리고 검증을 위한 Pydantic을 조합하여 사용합니다. 사용자는 Contract 클래스를 정의하여 추출하려는 필드와 제약 조건을 지정합니다. 그런 다음 Extractor가 선택된 파서를 통해 문서를 로드하고, LLM을 통해 텍스트를 처리하며, 출력을 검증된 Pydantic 객체에 매핑합니다. 복잡한 워크플로우를 위해 문서 분류, 혼합 번들 분할, 완료 전략을 통한 긴 입력 처리 도구도 포함되어 있습니다.
대상 사용자
다양한 문서 형식에서 특정 데이터를 추출하고, 결과 데이터가 엄격한 유형 및 값 스키마를 준수하도록 보장해야 하는 개발자를 위해 설계되었습니다.
주요 특징
- 유형화된 데이터 추출: Pydantic 계약을 사용하여 추출된 데이터가 검증되고 유형화되었음을 보장합니다.
- 문서 다양성: PDF, 이미지, 표, 스프레드시트를 위한 다중 로더 지원(PyMuPDF, Camelot, Tabula, Adobe 포함).
- 워크플로우 도구: 문서 분류 및 분할을 위한 내장 기능 포함.
- 유연한 LLM 통합: Ollama를 통해 다양한 제공업체 및 로컬 모델과 호환됩니다.
- 고급 기능: 병렬 필드 추출, SQLite를 사용한 페이지 검색, MCP 서비스 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트