aryn-ai/sycamore

🍁 Sycamore is an LLM-powered search and analytics platform for unstructured data.

What it solves

Sycamoreは、AIアプリケーションで使用するために、複雑なドキュメント(PDF、レポート、プレゼンテーションなど)からの非構造化データを処理する際の困難に対処します。抽出プロセス中に、表、図、グラフを含むドキュメントのセマンティックな構造を保持することで、RAG(Retrieval-Augmented Generation)システムにおける不適切なデータチャンク分割や低リコール(検索精度)の問題を解決します。

How it works

Sycamoreは、「DocSet」抽象化を使用して、非構造化ドキュメントの変換と操作を管理します。これは、深層学習DETR AIモデルを使用してドキュメントをセグメント化、ラベル付け、およびOCRを実行するGPU駆動のAPIであるAryn DocParseと統合されています。ユーザーは、高レベルのPython変換を適用してデータをクリーンアップ、強化、抽出することができ、その結果得られる高品質なチャンクをさまざまなベクトルデータベースやハイブリッド検索エンジンにロードできます。

Who it’s for

これは、RAG、LLMベースのアプリケーション、および非構造化データの分析のためのETLパイプラインを構築する開発者やデータエンジニア向けに設計されています。

Highlights

  • Semantic Document Partitioning: Vision AIを使用して、表やインフォグラフィックを含む複雑なドキュメントの構造を保持します。
  • Scalable Processing: 大規模なデータ処理を扱うためにRay backendに基づいて構築されています。
  • Flexible Integration: Pinecone, Weaviate, Qdrant, OpenSearch, ElasticSearch, and DuckDBを含む複数のベクトルデータベースをサポートしています。
  • Extensible Transforms: LLMを活用したユーザー定義関数(UDFs)と、S3およびHTTP用の自動データクローラーを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト