Zipstack/unstract

LLM-Driven Extraction of Unstructured Data — Built for API Deployments & ETL Pipeline Workflows

What it solves

Unstract는 PDF, 이미지, 스캔 등 비구조화 문서를 구조화된 JSON 데이터로 변환하는 과정을 자동화합니다. 각기 다른 문서 공급업체마다 복잡한 정규식이나 맞춤 템플릿을 작성할 필요 없이, 자연어 프롬프트로 추출 스키마를 정의할 수 있습니다.

How it works

플랫폼은 Large Language Models(LLM)을 사용해 문서를 파싱합니다. 사용자는 "Prompt Studio"에서 추출하고자 하는 내용을 정의하고, 시스템은 텍스트 추출기(LLMWhisperer 또는 Unstructured.io 등)와 LLM 제공자(OpenAI, Anthropic, Ollama 등)의 파이프라인을 통해 파일을 처리합니다. 결과로 생성된 구조화 데이터는 REST API로 배포하거나, S3 또는 Google Drive와 같은 소스에서 Snowflake, BigQuery와 같은 데이터 웨어하우스로 데이터를 이동시키는 ETL 파이프라인에 통합할 수 있습니다.

Who it’s for

금융, 보험, 헬스케어, KYC/컴플라이언스 등 데이터가 많은 산업 분야의 팀을 위해 설계되었습니다. 다양한 문서 형식에서 특정 정보를 추출해야 합니다.

Highlights

  • Prompt Studio: 코딩이 아닌 자연어로 추출 스키마 정의.
  • Multi-Provider Support: OpenAI, Anthropic, Bedrock, Gemini, Mistral, Ollama 등 다양한 LLM 제공자와 Qdrant, Pinecone, Weaviate 등 벡터 데이터베이스와 호환.
  • Extensible Integration: AI 에이전트를 위한 MCP 서버, n8n 노드 자동화 워크플로, 다양한 ETL 커넥터 제공.
  • Broad Format Support: PDF, DOCX, 스프레드시트, 프레젠테이션 및 다양한 이미지 형식 지원.
  • Enterprise Features: 듀얼 LLM 검증(LLMChallenge), 인간 검토 루프, 관리형 버전에서 SOC 2/HIPAA 준수 제공.