PaperGuru-AI/PaperGuru-Benchmark
Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB
What it solves
PaperGuru は、マルチデイのソフトウェアエンジニアリングや 200K トークン規模の文献調査、PDF からの研究論文再現といった長期タスクにおける現在の LLM エージェントの制限を解決します。これらのタスクの上限は、推論能力ではなく、セッション間で情報を記憶・取得できるシステムの能力に依存しています。単純な RAG やエージェント固有のメモリハックを、正式な「Lifecycle‑Aware Memory」(LAM) システムに置き換えます。
How it works
PaperGuru は Capital Chunk Memory (CCM) アーキテクチャを実装し、メモリを 2 つのサーフェスに分割します:ルーティング用のコンパクトな「chunk heads」と、生テキスト用の無制限「chunk contents」。構造エッジ(例:引用)と歴史的因果エッジ(例:廃止)を持つ時間的アーティファクトグラフを使用して情報を管理します。
システムは 4 段階のパイプラインに従います:
- Search:ランク付けされたアーティファクトヘッドを特定。
- Extract:証拠に基づく「evidence cards」を生成。
- Reason:Compose → Critique → Mutate ループを用いてドラフトセグメントを作成。
- Verify:引用付き・証拠チェック済みの出力を生成。
Who it’s for
高忠実度の検索、情報のバージョニング、検証可能な証拠が必要な長期 LLM エージェントを構築する研究者や開発者向けです。特に学術研究やコード再現といった複雑なタスクに適しています。
Highlights
- Lifecycle‑Aware Memory:バージョン化されたコンテンツ、マルチホップ関連性、クエリコストの上限、証拠に基づく合成という 4 つの公理を満たす。
- State-of-the-Art Performance:PaperBench(論文からコードへの再現)と SurveyBench(長文調査執筆)でベンチマークを上回る。
- Proven Utility:ICML や FSE などのトップカンファレンスで採択された 10 本の査読付き論文作成を支援。
- Evidence‑Grounded Richness:既存ベースラインと比較して、生成された調査における図表、テーブル、実行可能コードの含有率が大幅に向上。