Ontos-AI/knowhere

Knowhere extracts, parses, and outputs structured chunks ready for AI Agents and RAG.

해결하는 문제

Knowhere는 AI 에이전트를 위한 '더러운' 또는 복잡한 비구조화 문서(예: PDF 및 파워포인트 슬라이드)를 준비하는 어려움을 해결합니다. 기존 RAG는 고립된 스니펫의 평면 벡터 검색이나 취약한 OCR/레이아웃 추출에 의존하는 경우가 많아 문서의 원래 구조, 읽기 순서, 시각적 맥락이 손실되어 신뢰할 수 없는 모델 응답을 초래합니다.

작동 방식

Knowhere는 두 단계 프로세스를 통해 문서를 지속 가능한 탐색 가능한 메모리 시스템으로 변환합니다.

  1. 분석 및 메모리 구축: 이중 트랙 접근 방식을 사용합니다. 텍스트 트랙은 신뢰할 수 있는 텍스트 문서의 네이티브 구조를 유지하고, 비전 트랙은 최전방 비전 모델을 사용해 복잡한 페이지를 종합적으로 이해합니다. 두 트랙은 단일 계층 네이티브 스키마로 정규화되어 탐색 트리, 연결된 자산, 문서 간 관계를 저장합니다.
  2. 에이전트 기반 검색: 고정된 파이프라인 대신 Knowhere는 도구 모음(개요, 구조 필터, 퍼지 검색 등)을 제공합니다. AI 에이전트는 이 메모리를 탐색하는 방법을 스스로 결정합니다 — 섹션 트리를 따라가거나 특정 영역에 집중하여 추적 가능한 증거를 찾고 인용할 수 있습니다.

대상 사용자

구조적 맥락과 시각적 증거가 중요한 복잡한 로컬 또는 오프라인 문서 컬렉션에서 고정밀 검색이 필요한 AI 에이전트 및 LLM 워크플로우를 개발하는 개발자들을 위한 것입니다.

주요 특징

  • 이중 트랙 분석: 복잡한 PDF 및 슬라이드에 대해 텍스트 네이티브 추출과 비전 기반 페이지 이해를 결합합니다.
  • 계층 네이티브 메모리: 단절된 청크가 아닌 문서 경로, 페이지 범위, 섹션 노드를 유지합니다.
  • 에이전트 기반 검색: 에이전트가 문서의 섹션 트리와 문서 간 그래프를 자율적으로 탐색할 수 있도록 합니다.
  • 페이지 기반 인용: 소스 문서, 섹션 경로, 렌더링된 시각적 증거를 포함한 추적 가능한 참조를 제공합니다.
  • 다중 문서 메모리 그래프: 유형화된 엔티티와 키워드를 사용해 네임스페이스 내 관련 문서를 연결합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트