Unstructured-IO/unstructured

Convert documents to structured data effortlessly. Unstructured is open-source ETL solution for transforming complex documents into clean, structured formats for language models. Visit our website to learn more about our enterprise grade Platform product for production grade workflows, partitioning, enrichments, chunking and embedding.

What it solves

PDF, HTML, Word 문서, 이미지 등 비구조화 데이터를 가져와 전처리하여 구조화된 형식으로 변환하는 과정을 단순화합니다. 이는 일반적으로 깨끗하고 구조화된 텍스트를 필요로 하는 대규모 언어 모델(LLM)의 데이터 처리 워크플로우를 효율화하도록 설계되었습니다.

How it works

이 라이브러리는 모듈식 함수와 커넥터 시스템을 사용해 문서를 가져옵니다. 주요 메커니즘은 partition 함수이며, 문서의 파일 유형을 자동으로 감지하고 적절한 파티셔닝 로직으로 라우팅하여 텍스트 블록, 제목, 리스트와 같은 구조화된 요소로 분해합니다.

Who it’s for

LLM 기반 애플리케이션을 구축하는 개발자와 데이터 엔지니어를 위해 설계되었습니다. 다양한 실제 환경의 복잡한 문서 형식을 머신러닝 파이프라인에 적합한 형식으로 변환하는 신뢰할 수 있는 방법을 제공합니다.

Highlights

  • Broad Format Support: PDF, HTML, Word 문서, 이메일, 이미지 등을 지원합니다.
  • Automatic Detection: partition 함수가 파일 유형을 자동으로 식별하여 가져오기 파이프라인을 단순화합니다.
  • Flexible Deployment: Python 라이브러리로 설치하거나 Docker 컨테이너로 실행할 수 있어 환경 관리가 용이합니다.
  • Extensible: 다양한 플랫폼에 맞게 확장할 수 있는 커넥터와 모듈식 함수를 제공합니다.