aryn-ai/sycamore

🍁 Sycamore is an LLM-powered search and analytics platform for unstructured data.

What it solves

Sycamore 解决了在 AI 应用中使用来自复杂文档(如 PDF、报告和演示文稿)的非结构化数据的处理难题。它通过在提取过程中保留文档的语义结构(包括表格、插图和图表),解决了 RAG (Retrieval-Augmented Generation) 系统中数据分块质量差和召回率低的问题。

How it works

Sycamore 使用 "DocSet" 抽象来管理非结构化文档的转换和操作。它集成了 Aryn DocParse,这是一个由 GPU 驱动的 API,使用深度学习 DETR AI 模型对文档进行分段、标记和执行 OCR。用户可以应用高级 Python 转换来清洗、丰富和提取数据,然后将生成的高质量分块加载到各种向量数据库或混合搜索引擎中。

Who it’s for

它专为构建用于 RAG、基于 LLM 的应用以及非结构化数据分析的 ETL 流水线的开发人员和数据工程师设计。

Highlights

  • Semantic Document Partitioning: 使用视觉 AI 来保留复杂文档的结构,包括表格和信息图。
  • Scalable Processing: 基于 Ray 后端构建,以处理大规模数据处理。
  • Flexible Integration: 支持多种向量数据库,包括 Pinecone, Weaviate, Qdrant, OpenSearch, ElasticSearch, 和 DuckDB。
  • Extensible Transforms: 提供由 LLM 驱动的用户自定义函数 (UDFs) 和针对 S3 和 HTTP 的自动数据爬虫。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目