PaperGuru-AI/PaperGuru-Benchmark
Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB
What it solves
PaperGuru 解决了当前 LLM 代理在长时任务(例如多天的软件工程、撰写 200K 令牌的文献综述,或从 PDF 复现研究论文)中的局限——此类任务的瓶颈在于系统跨会话记忆与检索信息的能力,而非推理能力。它以正式的「Lifecycle‑Aware Memory」(LAM) 系统取代了简单的 RAG 或针对代理的记忆 hack。
How it works
PaperGuru 实现了 Capital Chunk Memory (CCM) 架构,将记忆分为两层表面:用于路由的紧凑「chunk heads」以及用于原始文字的无界「chunk contents」。它使用带有结构边(例如引用)与历史因果边(例如弃用)的时间性文献图来管理信息。
系统遵循四阶段流水线:
- Search:识别排序后的文献头部。
- Extract:生成可追溯的「evidence cards」。
- Reason:使用 Compose → Critique → Mutate 循环生成草稿段落。
- Verify:产出已引用、经过可追溯检查的输出。
Who it’s for
此工具针对需要高保真检索、信息版本管理与可验证可追溯性的长期 LLM 代理开发者与研究者,特别是学术研究与代码复现等复杂任务。
Highlights
- Lifecycle‑Aware Memory:满足四项公理,包括版本化内容、多跳相关性、受限查询成本与可追溯合成。
- State-of-the-Art Performance:在 PaperBench(论文到代码复现)与 SurveyBench(长篇调查写作)上超越基线。
- Proven Utility:协助完成 10 篇在 ICML、FSE 等顶级会议接受的同行评审论文。
- Evidence‑Grounded Richness:相较于现有基线,大幅提升生成调查中图表、表格与可执行代码的包含率。