benchen4395/alpha_agentic_search

Alpha Agentic Search — 分层记忆 RAG 检索问答系统

解决的问题

Alpha Agentic Search (AAS) 解决了传统 AI 搜索代理的不稳定性、高延迟和缺乏个性化等问题。它提供了一个可控且低延迟的网页问答 (Q&A) 框架,通过实现分层记忆系统来随时间不断改进,确保频繁或先前已回答的问题能以毫秒级的响应时间处理,同时维持高度的事实准确性。

运作方式

系统遵循经典的 Route → Rewrite → Retrieve → Verify → Summary 管道:

  1. 短路 (L1): 检查 QA 缓存以获取精确或模糊匹配,借此瞬间返回答案。
  2. 路由: 判断是否有专用工具(例如 Weather、GitHub、arXiv)可以回答该查询;若否,则继续进行检索。
  3. 重写: 将时间和位置上下文注入查询中,以提升搜索精准度。
  4. 分层 RAG (L1–L5): 并行从五个层级检索数据:L1 (QA Cache)、L2 (Wikipedia)、L3 (History)、L4 (Real-time Web) 和 L5 (Knowledge Graph)。结果使用 Reciprocal Rank Fusion (RRF) 进行融合,并校准为相关性概率。
  5. 摘要: LLM 将检索到的证据综合成最终答案,并附带来源归因和引文验证。

适用对象

  • AI 工程师与架构师 正在寻找一个优先考虑稳定性和低延迟而非纯研究的生产就绪搜索代理框架。
  • 开发者 希望构建具备“越用越强”记忆机制的个人搜索助手。
  • AI 搜索领域的初学者 希望有一个多代理搜索管道的参考实现。

亮点

  • 5 层记忆堆栈: 结合快速缓存、教科书常识、用户历史记录、实时网页和结构化知识图谱。
  • 跨层分数校准: 使用 Platt scaling 将不同的评分指标(cosine、rank 等)映射到统一的置信度分数。
  • L1 缓存护栏: 实施严格的准入策略和“slot gate”一致性检查,以防止缓存错误或过时的答案。
  • 提示注入防护: 采用三层防御(内容清理、XML 结构分隔符和系统提示守卫)来保护不受信任的网页内容。
  • 延迟治理: 具备分层延迟预算、软超时和策略性的“RAG-first, LLM-last”预热序列,以最小化 TTFT。
  • 实体消歧: 使用流行度 (in-degree) 和查询上下文信号的组合,来解析知识图谱中模糊的实体。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目