PageIndex: 복잡한 문서를 위한 유사도 검색을 reasoning-based tree retrieval로 대체하는 벡터리스 RAG 엔진

해결하는 문제

전통적인 벡터 기반 Retrieval-Augmented Generation(RAG)은 종종 의미적 유사성에 의존하며, 이는 복잡하고 전문적인 문서에서 실제로 관련된 정보를 찾는 데 실패할 수 있습니다. PageIndex는 유사도 기반 검색을 reasoning-based retrieval로 대체함으로써これを 해결하며, 시스템이 단순히 비슷한 소리의 텍스트가 아닌 관련성과 맥락적 이해에 기반하여 정보를 찾도록 보장합니다.

작동 방식

PageIndex는 긴 문서를 인공적인 청크로 나누는 대신 계층적 트리 구조 인덱스(상세한 목차와 유사)로 변환합니다.その後, LLMs를 사용하여 에이전트 트리 검색을 수행하고, 인덱스를 통해 reasoning하여 문서의 가장 관련된 섹션으로 이동합니다. 이 과정은 인간 전문가가 복잡한 파일을 읽고 탐색하는 방식과 유사하여, 검색 프로세스를 추적 가능하고 설명 가능하게 만듭니다.

대상 사용자

이는 재무 보고서, 법적 서류, 규제 문서, 기술 매뉴얼, 학술 교과서와 같은 길고 복잡한 전문 문서를 다루는 사용자를 위해 설계되었습니다.

주요 특징

  • Vectorless RAG: 벡터 데이터베이스와 청킹이 필요 없도록 제거합니다.
  • Reasoning-Driven: 컨텍스트 인식 검색을 위해 LLM 기반 트리 검색을 사용합니다.
  • High Accuracy: FinanceBench 벤치마크에서 98.7% 정확도를 달성했습니다.
  • Traceable Results: 더 나은 설명 가능성을 위해 명시적인 페이지 및 섹션 참조를 기반으로 합니다.
  • Flexible Deployment: 자체 호스팅 오픈소스 도구, 클라우드 서비스, 또는 기업 배포 형태로 제공됩니다.

Sources