Zipstack/unstract

LLM-Driven Extraction of Unstructured Data — Built for API Deployments & ETL Pipeline Workflows

What it solves

Unstract 自动化将 PDF、图像、扫描件等非结构化文档转换为结构化 JSON 数据的过程。它取代了为每个不同文档供应商编写复杂正则表达式或自定义模板的需求,让用户能够使用自然语言提示定义抽取 schema。

How it works

平台使用大型语言模型(LLM)解析文档。用户通过“Prompt Studio”定义想要抽取的内容,系统将文件通过文本抽取器(如 LLMWhisperer 或 Unstructured.io)和 LLM 提供商(如 OpenAI、Anthropic、Ollama)的管道处理。生成的结构化数据可以部署为 REST API,或集成到 ETL 流程中,将数据从 S3、Google Drive 等来源搬入 Snowflake、BigQuery 等数据仓库。

Who it’s for

它面向金融、保险、医疗保健、KYC/合规等数据密集型行业的团队,需要从各种文档格式中提取特定信息。

Highlights

  • Prompt Studio:使用自然语言而非代码定义抽取 schema。
  • Multi-Provider Support:兼容多种 LLM 提供商(OpenAI、Anthropic、Bedrock、Gemini、Mistral、Ollama)和向量数据库(Qdrant、Pinecone、Weaviate)。
  • Extensible Integration:包括 AI 代理的 MCP 服务器、n8n 节点自动化工作流,以及丰富的 ETL 连接器。
  • Broad Format Support:支持 PDF、DOCX、电子表格、演示文稿及各种图像格式。
  • Enterprise Features:提供双 LLM 验证(LLMChallenge)、人工审查环节,并在托管版中符合 SOC 2/HIPAA 合规要求。