AutoTrustAI/PaperGuru-Benchmark

Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB

What it solves

PaperGuru 解决了当前 LLM 代理在长时任务(如撰写 20 万 token 的调查报告或复现复杂研究论文)中的局限,传统的 RAG 或上下文窗口已不足以应对。它引入了“生命周期感知记忆”(LAM)原语,防止代理使用过时信息、处理跨引用的多跳相关性,并在档案库增长时仍能保持恒定的查询成本。

How it works

系统使用 Capital Chunk Memory (CCM) 架构,将记忆分为两层:

  1. Chunk heads:每个工件一个的紧凑路由表面,用于高效搜索。
  2. Chunk contents:完整原始文本,仅在需要时访问。

信息通过 时间工件图 组织,图中包含结构边(例如 citesimplements)和历史因果边(例如 superseded-byretracted-by)。处理流水线遵循 Search → Extract → Reason → Verify 流程,生成基于来源的“证据卡”,代理利用这些卡片来组合、批判和修改输出。

Who it’s for

适用于构建长时任务 LLM 代理的研究人员和开发者,领域包括学术研究、软件工程或临床证据合成,需要能够追踪版本和来源的记忆系统。

Highlights

  • State-of-the-Art Performance:在 PaperBench(论文到代码复现)和 SurveyBench(长篇调查写作)上优于基线。
  • Lifecycle Awareness:专为处理信息的修订、弃用和撤回而设计。
  • Provenance Grounding:输出中的每一项主张都可追溯到记忆中的可验证工件。
  • Causal Graph Routing:利用时间工件图寻找多跳证据,而非仅依赖余弦相似度。