Zipstack/unstract

LLM-Driven Extraction of Unstructured Data — Built for API Deployments & ETL Pipeline Workflows

What it solves

Unstract は、PDF、画像、スキャン画像などの非構造化ドキュメントを構造化 JSON データに変換するプロセスを自動化します。各ベンダーごとに複雑な正規表現やカスタムテンプレートを作成する必要がなく、自然言語プロンプトで抽出スキーマを定義できるようにします。

How it works

プラットフォームは Large Language Models(LLM)を使用してドキュメントを解析します。ユーザーは「Prompt Studio」で抽出したい項目を定義し、システムはテキスト抽出器(LLMWhisperer や Unstructured.io など)と LLM プロバイダー(OpenAI、Anthropic、Ollama など)のパイプラインを通してファイルを処理します。生成された構造化データは REST API としてデプロイしたり、S3 や Google Drive などのソースから Snowflake や BigQuery といったデータウェアハウスへデータを移動させる ETL パイプラインに組み込んだりできます。

Who it’s for

金融、保険、ヘルスケア、KYC/コンプライアンスなど、データ量が多い業界のチーム向けです。さまざまなドキュメント形式から特定情報を抽出する必要があります。

Highlights

  • Prompt Studio:コードではなく自然言語で抽出スキーマを定義。
  • Multi-Provider Support:OpenAI、Anthropic、Bedrock、Gemini、Mistral、Ollama など多数の LLM プロバイダーと、Qdrant、Pinecone、Weaviate などのベクトルデータベースに対応。
  • Extensible Integration:AI エージェント用 MCP サーバー、n8n ノードによる自動化ワークフロー、豊富な ETL コネクタを提供。
  • Broad Format Support:PDF、DOCX、スプレッドシート、プレゼンテーション、各種画像形式に対応。
  • Enterprise Features:デュアル LLM 検証(LLMChallenge)やヒューマン・イン・ザ・ループレビュー、マネージド版での SOC 2/HIPAA コンプライアンスを提供。