PaperGuru-AI/PaperGuru-Benchmark
Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB
What it solves
PaperGuru 解決了當前 LLM 代理在長期任務(例如多天的軟體工程、撰寫 200K 令牌的文獻調查,或從 PDF 再現研究論文)中的限制——此類任務的瓶頸在於系統跨會話記憶與檢索資訊的能力,而非推理能力。它以正式的「Lifecycle‑Aware Memory」(LAM) 系統取代了簡單的 RAG 或針對代理的記憶 hack。
How it works
PaperGuru 實作了 Capital Chunk Memory (CCM) 架構,將記憶分為兩層表面:用於路由的緊湊「chunk heads」以及用於原始文字的無界「chunk contents」。它使用帶有結構邊(例如引用)與歷史因果邊(例如棄用)的時間性文獻圖來管理資訊。
系統遵循四階段流水線:
- Search:識別排序後的文獻頭部。
- Extract:產生可追溯的「evidence cards」。
- Reason:使用 Compose → Critique → Mutate 迴圈產生草稿段落。
- Verify:產出已引用、經過可追溯檢查的輸出。
Who it’s for
此工具針對需要高保真檢索、資訊版本管理與可驗證可追溯性的長期 LLM 代理開發者與研究者,特別是學術研究與程式碼再現等複雜任務。
Highlights
- Lifecycle‑Aware Memory:滿足四項公理,包括版本化內容、多跳相關性、受限查詢成本與可追溯合成。
- State-of-the-Art Performance:在 PaperBench(論文到程式碼再現)與 SurveyBench(長篇調查寫作)上超越基線。
- Proven Utility:協助完成 10 篇在 ICML、FSE 等頂級會議接受的同行評審論文。
- Evidence‑Grounded Richness:相較於現有基線,大幅提升生成調查中圖表、表格與可執行程式碼的包含率。