aryn-ai/sycamore
🍁 Sycamore is an LLM-powered search and analytics platform for unstructured data.
What it solves
Sycamore는 AI 애플리케이션에서 사용하기 위해 복잡한 문서(PDF, 보고서, 프레젠테이션 등)로부터 비정형 데이터를 처리하는 데 따르는 어려움을 해결합니다. Sycamore는 추출 과정에서 표, 그림, 그래프를 포함한 문서의 의미론적 구조를 보존함으로써 RAG(Retrieval-Augmented Generation) 시스템의 데이터 청킹(chunking) 품질 저하 및 낮은 재현율(recall) 문제를 해결합니다.
How it works
Sycamore는 비정형 문서의 변환 및 조작을 관리하기 위해 "DocSet" 추상화 계층을 사용합니다. 이는 문서의 세그먼트를 나누고, 레이블을 지정하며, OCR을 수행하기 위해 딥러닝 DETR AI 모델을 사용하는 GPU 기반 API인 Aryn DocParse와 통합됩니다. 사용자는 고수준의 Python 변환 기능을 적용하여 데이터를 정제, 보강 및 추출한 다음, 결과로 생성된 고품질의 청크(chunks)를 다양한 벡터 데이터베이스나 하이브리드 검색 엔진에 로드할 수 있습니다.
Who it’s for
이 도구는 RAG, LLM 기반 애플리케이션 및 비정형 데이터 분석을 위한 ETL 파이프라인을 구축하는 개발자와 데이터 엔지니어들을 위해 설계되었습니다.
Highlights
- Semantic Document Partitioning: 비전 AI를 사용하여 표와 인포그래픽을 포함한 복잡한 문서의 구조를 보존합니다.
- Scalable Processing: 대규모 데이터 처리를 위해 Ray 백엔드를 기반으로 구축되었습니다.
- Flexible Integration: Pinecone, Weaviate, Qdrant, OpenSearch, ElasticSearch, DuckDB를 포함한 다양한 벡터 데이터베이스를 지원합니다.
- Extensible Transforms: LLM 기반의 사용자 정의 함수(UDFs)와 S3 및 HTTP를 위한 자동 데이터 크롤러를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트