ucbepic/docetl
A system for agentic LLM-powered data processing and ETL
What it solves
DocETL は、LLM を使用して大量の構造化データと非構造化データを分析・変換するプロセスを簡素化します。精度、コスト、レイテンシーの観点から個々の LLM 呼び出しを手動で記述・接続・チューニングする必要がなくなります。
How it works
ユーザーは自然言語プロンプトでデータ処理操作(map、reduce、filter など)を定義します。DocETL はこれらの操作をオーケストレーションし、データセット全体にわたってワークロードを並列化し、結果をクエリ可能なテーブルとして返します。システムはモデルの切り替え、プロンプトの書き換え、操作の分解、または LLM タスクをコードに置き換えることでパイプラインを自動的に最適化し、精度を向上させコストを削減します。
Who it’s for
このツールは、Python API、ローコード YAML 設定、またはビジュアルインターフェースを通じて大規模な文書コレクションを処理したい開発者やデータアナリスト向けに設計されています。
Highlights
- Declarative Pipelines: Define complex workflows using simple operators like map and reduce.
- Automatic Optimization: Uses agentic rewrites to balance cost and accuracy automatically.
- Flexible Interfaces: Supports a Python API, YAML configs, and a visual playground called DocWrangler.
- Scalable Execution: Handles parallelization and rate limiting across various LLM providers.