AutoTrustAI/PaperGuru-Benchmark

Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB

What it solves

PaperGuru は、200K トークン規模のサーベイ作成や複雑な研究論文の再現といった長期タスクにおける現在の LLM エージェントの限界を解決します。従来の RAG やコンテキストウィンドウでは不十分です。エージェントが古い情報を使用しないようにし、引用間のマルチホップ関連性を処理し、アーカイブが増大してもクエリコストを一定に保つ「Lifecycle-Aware Memory(LAM)」プリミティブを導入します。

How it works

システムは Capital Chunk Memory (CCM) アーキテクチャを採用し、メモリを二層に分割します:

  1. Chunk heads:各アーティファクトごとに1つのコンパクトなルーティングサーフェスで、効率的な検索に使用します。
  2. Chunk contents:必要なときにのみアクセスする完全な生テキストです。

情報は 時間的アーティファクトグラフ で整理され、構造エッジ(例:citesimplements)と歴史的因果エッジ(例:superseded-byretracted-by)を持ちます。処理パイプラインは Search → Extract → Reason → Verify のフローに従い、出典に根拠付けされた「エビデンスカード」を生成し、エージェントはこれを用いて出力を構成、批評、変異させます。

Who it’s for

学術研究、ソフトウェアエンジニアリング、臨床エビデンス合成など、バージョン管理と出典追跡が必要な長期タスク向け LLM エージェントを構築する研究者や開発者向けです。

Highlights

  • State-of-the-Art Performance:PaperBench(論文からコードの再現)および SurveyBench(長文サーベイ執筆)でベンチマークを上回ります。
  • Lifecycle Awareness:情報の改訂、廃止、撤回に特化して設計されています。
  • Provenance Grounding:出力のすべての主張はメモリ内の検証可能なアーティファクトに遡ることができます。
  • Causal Graph Routing:コサイン類似度だけに頼らず、時間的アーティファクトグラフを用いて複数ホップ離れた証拠を見つけます。