AutoTrustAI/PaperGuru-Benchmark
Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB
What it solves
PaperGuru 解決了目前 LLM 代理在長期任務(例如撰寫 20 萬 token 的調查報告或重現複雜研究論文)中的限制,傳統的 RAG 或上下文窗口已不足以應付。它引入了「生命週期感知記憶」(LAM) 原語,防止代理使用過時資訊、處理跨引用的多跳相關性,並在檔案庫成長時仍能維持恆定的查詢成本。
How it works
系統採用 Capital Chunk Memory (CCM) 架構,將記憶分為兩層:
- Chunk heads:每個工件一個的緊湊路由表面,用於高效搜尋。
- Chunk contents:完整原始文字,僅在需要時存取。
資訊透過 時間工件圖 組織,圖中包含結構邊(例如 cites、implements)與歷史因果邊(例如 superseded-by、retracted-by)。處理流程遵循 Search → Extract → Reason → Verify 流程,產生以來源為基礎的「證據卡」,代理利用這些卡片來組合、批判與變更輸出。
Who it’s for
適用於開發長期任務 LLM 代理的研究人員與開發者,領域包括學術研究、軟體工程或臨床證據合成,需要能追蹤版本與來源的記憶系統。
Highlights
- State-of-the-Art Performance:在 PaperBench(論文到程式碼再現)與 SurveyBench(長篇調查寫作)上優於基線。
- Lifecycle Awareness:專為處理資訊的修訂、棄用與撤回而設計。
- Provenance Grounding:輸出中的每一項主張皆可追溯至記憶中的可驗證工件。
- Causal Graph Routing:利用時間工件圖尋找多跳證據,而非僅依賴餘弦相似度。