PaperGuru-AI/PaperGuru-Benchmark

Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB

What it solves

PaperGuru は、マルチデイのソフトウェアエンジニアリングや 200K トークン規模の文献調査、PDF からの研究論文再現といった長期タスクにおける現在の LLM エージェントの制限を解決します。これらのタスクの上限は、推論能力ではなく、セッション間で情報を記憶・取得できるシステムの能力に依存しています。単純な RAG やエージェント固有のメモリハックを、正式な「Lifecycle‑Aware Memory」(LAM) システムに置き換えます。

How it works

PaperGuru は Capital Chunk Memory (CCM) アーキテクチャを実装し、メモリを 2 つのサーフェスに分割します:ルーティング用のコンパクトな「chunk heads」と、生テキスト用の無制限「chunk contents」。構造エッジ(例:引用)と歴史的因果エッジ(例:廃止)を持つ時間的アーティファクトグラフを使用して情報を管理します。

システムは 4 段階のパイプラインに従います:

  1. Search:ランク付けされたアーティファクトヘッドを特定。
  2. Extract:証拠に基づく「evidence cards」を生成。
  3. Reason:Compose → Critique → Mutate ループを用いてドラフトセグメントを作成。
  4. Verify:引用付き・証拠チェック済みの出力を生成。

Who it’s for

高忠実度の検索、情報のバージョニング、検証可能な証拠が必要な長期 LLM エージェントを構築する研究者や開発者向けです。特に学術研究やコード再現といった複雑なタスクに適しています。

Highlights

  • Lifecycle‑Aware Memory:バージョン化されたコンテンツ、マルチホップ関連性、クエリコストの上限、証拠に基づく合成という 4 つの公理を満たす。
  • State-of-the-Art Performance:PaperBench(論文からコードへの再現)と SurveyBench(長文調査執筆)でベンチマークを上回る。
  • Proven Utility:ICML や FSE などのトップカンファレンスで採択された 10 本の査読付き論文作成を支援。
  • Evidence‑Grounded Richness:既存ベースラインと比較して、生成された調査における図表、テーブル、実行可能コードの含有率が大幅に向上。