ucbepic/docetl
A system for agentic LLM-powered data processing and ETL
What it solves
DocETL은 LLM을 활용해 방대한 구조화 데이터와 비구조화 데이터를 분석·변환하는 과정을 단순화합니다. 정확도, 비용, 지연 시간 측면에서 개별 LLM 호출을 수동으로 작성·연결·조정할 필요가 없어집니다.
How it works
사용자는 자연어 프롬프트를 통해 map, reduce, filter와 같은 데이터 처리 작업을 정의합니다. DocETL은 이러한 작업을 오케스트레이션하고, 데이터셋 전체에 걸쳐 워크로드를 병렬화하여 결과를 쿼리 가능한 테이블 형태로 반환합니다. 시스템은 모델 교체, 프롬프트 재작성, 작업 분해, 혹은 LLM 작업을 코드로 대체하는 방식으로 파이프라인을 자동 최적화해 정확도를 높이고 비용을 절감합니다.
Who it’s for
이 도구는 Python API, 저코드 YAML 설정, 혹은 시각적 인터페이스를 통해 대규모 문서 컬렉션을 처리해야 하는 개발자와 데이터 분석가를 위해 설계되었습니다.
Highlights
- Declarative Pipelines: Define complex workflows using simple operators like map and reduce.
- Automatic Optimization: Uses agentic rewrites to balance cost and accuracy automatically.
- Flexible Interfaces: Supports a Python API, YAML configs, and a visual playground called DocWrangler.
- Scalable Execution: Handles parallelization and rate limiting across various LLM providers.