Marker-Inc-Korea/AutoRAG

AutoRAG: Now your agent can find anything in your computer. It gets smarter if you are using it frequently.

해결하는 문제

AutoRAG는 대규모 문서 컬렉션을 위한 "사서 에이전트" 역할을 하며, 파일 경로와 매칭 라인만 제공하는 단순 검색 도구를 넘어섭니다. 사용자가 파일을 직접 열고, 컨텍스트를 읽고, 스스로 답을 합성하도록 강요하는 대신, AutoRAG는 검색·읽기·정리를 수행해 깨끗하고 번호가 매겨진 지식 단위로 정보를 제공하여 질의에 직접적인 답변을 제공합니다.

작동 방식

AutoRAG는 Pi 에이전트 루프를 기반으로 한 2계층 에이전트 아키텍처를 사용합니다. 상위 오케스트레이터가 계획, 메모리 체크, 검색 시드 작업을 담당하고, 이를 전문 탐색 에이전트에게 위임합니다. 이 탐색 에이전트들은 readgrepfindls와 같은 도구를 사용해 문서를 검사합니다.

고품질 검색을 보장하기 위해 여러 플러그인 가능한 방법을 사용합니다:

  • 어휘 검색: 키워드 순위를 매기기 위해 BM25 사용.
  • 의미 검색: 의미 이해를 위해 MinSync 사용.
  • 하이브리드 검색: 정밀도와 재현율을 모두 만족하도록 두 방식을 결합.
  • 디스커버리: 선택적으로 Jikji와 통합해 먼저 찾고 인덱싱하는 방식의 디스커버리를 제공.

또한 사용자 피드백과 이전 검색 결과를 학습해 특정 유형의 질의에 가장 생산적인 검색 방법과 문서 영역을 최적화하는 자체 진화 메모리 시스템을 갖추고 있습니다.

대상 사용자

주로 매뉴얼, 법률 문서, 내부 위키, 연구 논문, 회의 노트, PDF 등 코드가 아닌 문서 컬렉션을 관리하는 사람들을 위해 설계되었습니다.

주요 특징

  • 자체 진화 메모리: 사용량 및 명시적 사용자 피드백을 학습해 시간이 지남에 따라 검색 정확도를 향상.
  • 광범위한 데이터소스 지원: Slack, Discord, Notion, GitHub, Google Drive, Gmail, Obsidian 등 외부 소스와 연결 가능.
  • 다중 방법 검색: 동일 인터페이스에서 BM25와 의미 검색(MinSync)을 결합.
  • 구조화된 출력: 원시 검색 결과가 아닌 정제된 지식 단위를 반환.
  • 레거시 지원: 레거시 HWP5 바이너리 파일에서 텍스트를 추출하는 WebAssembly 파서 포함.