PaperGuru-AI/PaperGuru-Benchmark

Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB

What it solves

PaperGuru 解決了當前 LLM 代理在長期任務(例如多天的軟體工程、撰寫 200K 令牌的文獻調查,或從 PDF 再現研究論文)中的限制——此類任務的瓶頸在於系統跨會話記憶與檢索資訊的能力,而非推理能力。它以正式的「Lifecycle‑Aware Memory」(LAM) 系統取代了簡單的 RAG 或針對代理的記憶 hack。

How it works

PaperGuru 實作了 Capital Chunk Memory (CCM) 架構,將記憶分為兩層表面:用於路由的緊湊「chunk heads」以及用於原始文字的無界「chunk contents」。它使用帶有結構邊(例如引用)與歷史因果邊(例如棄用)的時間性文獻圖來管理資訊。

系統遵循四階段流水線:

  1. Search:識別排序後的文獻頭部。
  2. Extract:產生可追溯的「evidence cards」。
  3. Reason:使用 Compose → Critique → Mutate 迴圈產生草稿段落。
  4. Verify:產出已引用、經過可追溯檢查的輸出。

Who it’s for

此工具針對需要高保真檢索、資訊版本管理與可驗證可追溯性的長期 LLM 代理開發者與研究者,特別是學術研究與程式碼再現等複雜任務。

Highlights

  • Lifecycle‑Aware Memory:滿足四項公理,包括版本化內容、多跳相關性、受限查詢成本與可追溯合成。
  • State-of-the-Art Performance:在 PaperBench(論文到程式碼再現)與 SurveyBench(長篇調查寫作)上超越基線。
  • Proven Utility:協助完成 10 篇在 ICML、FSE 等頂級會議接受的同行評審論文。
  • Evidence‑Grounded Richness:相較於現有基線,大幅提升生成調查中圖表、表格與可執行程式碼的包含率。