benchen4395/alpha_agentic_search
Alpha Agentic Search — 分层记忆 RAG 检索问答系统
해결하는 문제
Alpha Agentic Search (AAS)는 기존 AI 검색 에이전트의 불안정성, 높은 지연 시간 및 개인화 부족 문제를 해결합니다. 계층적 메모리 시스템을 구현하여 시간이 지남에 따라 개선되는 제어 가능하고 저지연의 웹 기반 Q&A 프레임워크를 제공하여, 빈번하거나 이전에 답변된 질문이 높은 사실적 정확성을 유지하면서 밀리초 응답 시간으로 처리되도록 보장합니다.
작동 방식
시스템은 고전적인 Route → Rewrite → Retrieve → Verify → Summary 파이프라인을 따릅니다:
- 단락 (L1): QA 캐시에서 정확하거나 퍼지 일치 항목을 확인하여 즉시 답변을 반환합니다.
- 라우팅: 특수 도구(예: Weather, GitHub, arXiv)가 쿼리에 답변할 수 있는지 확인합니다. 그렇지 않으면 검색을 진행합니다.
- 재작성: 검색 정밀도를 높이기 위해 시간 및 위치 컨텍스트를 쿼리에 주입합니다.
- 계층적 RAG (L1–L5): 5개 레이어(L1 (QA Cache), L2 (Wikipedia), L3 (History), L4 (Real-time Web), L5 (Knowledge Graph))에서 병렬로 데이터를 검색합니다. 결과는 Reciprocal Rank Fusion (RRF)을 사용하여 융합되고 관련성 확률로 보정됩니다.
- 요약: LLM이 검색된 증거를 출처 표기 및 인용 검증과 함께 최종 답변으로 종합합니다.
대상 독자
- 안정성과 지연 시간을 순수 연구보다 우선시하는 프로덕션 준비된 검색 에이전트 프레임워크를 찾는 AI 엔지니어 및 아키텍트.
- "사용할수록 강해지는" 메모리 메커니즘을 갖춘 개인 검색 어시스턴트를 구축하려는 개발자.
- 멀티 에이전트 검색 파이프라인의 참조 구현을 원하는 AI 검색 분야의 초보자.
하이라이트
- 5계층 메모리 스택: 빠른 캐시, 교과서 상식, 사용자 기록, 실시간 웹 및 구조화된 지식 그래프를 결합합니다.
- 교차 레이어 점수 보정: Platt scaling을 사용하여 다양한 점수 측정 항목(cosine, rank 등)을 통합된 신뢰도 점수로 매핑합니다.
- L1 캐시 가드레일: 잘못되거나 오래된 답변의 캐싱을 방지하기 위해 엄격한 허용 정책과 "slot gate" 일관성 검사를 구현합니다.
- 프롬프트 인젝션 보호: 신뢰할 수 없는 웹 콘텐츠를 보호하기 위해 3계층 방어(콘텐츠 정리, XML 구조 구분 기호 및 시스템 프롬프트 가드)를 사용합니다.
- 지연 시간 관리: 계층화된 지연 시간 예산, 소프트 타임아웃 및 전략적인 "RAG-first, LLM-last" 웜업 시퀀스를 특징으로 하여 TTFT를 최소화합니다.
- 엔티티 모호성 해소: 지식 그래프에서 모호한 엔티티를 해결하기 위해 인기도(진입 차수)와 쿼리 컨텍스트 신호의 조합을 사용합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트