knowhere: 비정형 데이터를 계층적 그래프로 변환하여 에이전트형 RAG에 사용하는 문서 메모리 레이어
knowhere: 비정형 데이터를 계층적 그래프로 변환하여 에이전트형 RAG에 사용하는 문서 메모리 레이어
Knowhere는 비정형 파일을 탐색 가능한 계층적 메모리 그래프로 변환하여 RAG를 사용하는 AI 에이전트의 정확성과 추적 가능성을 향상시키는 문서 메모리 레이어입니다.
knowhere: 비정형 데이터를 계층적 그래프로 변환하여 에이전트형 RAG에 사용하는 문서 메모리 레이어
해결하는 문제
Knowhere는 복잡한 PDF, Office 파일, 이미지와 같은 AI 에이전트가 사용하기 어려운 '더러운' 비정형 문서의 문제를 해결합니다. 전통적인 RAG는 종종 이러한 문서를 의미적 맥락과 계층 구조를 잃게 하는 고립된 텍스트 스니펫으로 평탄화하여, AI 에이전트 응답의 정확성과 신뢰성을 낮춥니다.
작동 방식
Knowhere는 문서를 두 가지 주요 단계로 처리하는 메모리 레이어 역할을 합니다.
- 파싱 및 메모리 구축: 특수 파서(MinerU 등)를 사용하여 멀티모달 파일을 ingest합니다. 그런 다음 독점적인 트리 유사 알고리즘이 문서의 원래 계층 구조를 재구성하고 가벼운 메모리 그래프를 구축하여 청크가 의미적 맥락과 관계를 유지하도록 합니다.
- 에이전트형 검색: 간단한 벡터 조회 대신, AI 에이전트는 재구성된 섹션 트리와 그래프 링크를 탐색します。これにより、エージェントは人間の読者のようにドキュメントの関連領域に"ドリルダウン"でき、追跡可能なソースパスに基づいて引用を提供できます。
대상 사용자
이는 복잡하고 긴 형식 또는 멀티모달 문서를 처리하면서 높은 검색 정확도와 증거 기반 추적 가능성을 유지해야 하는 AI 에이전트 및 Agentic RAG 워크플로를 구축하는 개발자를 위해 설계되었습니다.
주요 특징
- 멀티모달 지원: VLM을 사용하여 테이블과 이미지를 추출 및 요약하고 소스 텍스트로 연결합니다.
- 계층 구조 보존: 의미적 fragmentation을 방지하기 위해 문서 구조를 재구성합니다.
- 에이전트형 탐색: 전통적인 검색(RRF)과 문서 트리 및 그래프의 자율적 탐색을 결합합니다.
- 광범위한 형식 지원: PDF, DOCX, PPTX, XLSX, CSV, 이미지, Markdown 및 텍스트를 처리합니다.
- 모델에 구애받지 않음: DeepSeek, Qwen, OpenAI 등을 포함한 다양한 LLM/VLM 제공업체를 지원합니다.