benchen4395/alpha_agentic_search

Alpha Agentic Search — 分层记忆 RAG 检索问答系统

解決的問題

Alpha Agentic Search (AAS) 解決了傳統 AI 搜尋代理的不穩定性、高延遲和缺乏個人化等問題。它提供了一個可控且低延遲的網頁問答 (Q&A) 框架,透過實作分層記憶系統來隨時間不斷改善,確保頻繁或先前已回答的問題能以毫秒級的回應時間處理,同時維持高度的事實準確性。

運作方式

系統遵循經典的 Route → Rewrite → Retrieve → Verify → Summary 管線:

  1. 短路 (L1): 檢查 QA 快取以取得精確或模糊比對,藉此瞬間回傳答案。
  2. 路由: 判斷是否有專用工具(例如 Weather、GitHub、arXiv)可以回答該查詢;若否,則繼續進行檢索。
  3. 重寫: 將時間和位置上下文注入查詢中,以提升搜尋精準度。
  4. 分層 RAG (L1–L5): 平行從五個層級檢索資料:L1 (QA Cache)、L2 (Wikipedia)、L3 (History)、L4 (Real-time Web) 和 L5 (Knowledge Graph)。結果使用 Reciprocal Rank Fusion (RRF) 進行融合,並校準為相關性機率。
  5. 摘要: LLM 將檢索到的證據綜合成最終答案,並附帶來源歸因和引文驗證。

適用對象

  • AI 工程師與架構師 正在尋找一個優先考慮穩定性和低延遲而非純研究的生產就緒搜尋代理框架。
  • 開發者 希望建立具備「越用越強」記憶機制的個人搜尋助理。
  • AI 搜尋領域的初學者 希望有一個多代理搜尋管線的參考實作。

亮點

  • 5 層記憶堆疊: 結合快速快取、教科書常識、使用者歷史記錄、即時網頁和結構化知識圖譜。
  • 跨層分數校準: 使用 Platt scaling 將不同的評分指標(cosine、rank 等)對應到統一的信心分數。
  • L1 快取護欄: 實作嚴格的准入政策和「slot gate」一致性檢查,以防止快取錯誤或過時的答案。
  • 提示注入防護: 採用三層防禦(內容清理、XML 結構分隔符號和系統提示守衛)來保護不受信任的網頁內容。
  • 延遲治理: 具備分層延遲預算、軟逾時和策略性的「RAG-first, LLM-last」預熱序列,以最小化 TTFT。
  • 實體消歧: 使用流行度 (in-degree) 和查詢上下文訊號的組合,來解析知識圖譜中模糊的實體。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案