HUST-AI-HYZ/MemoryAgentBench
Open source code for ICLR 2026 Paper: Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
What it solves
インクリメンタルでマルチターンの対話において、LLM エージェントが記憶をどれだけうまく扱えるかを評価する標準化されたベンチマークを提供します。単一の長いプロンプトを処理するだけでなく、長時間の会話で提供された情報を記憶し、更新し、矛盾を解消する能力を測定する必要性に応えます。
How it works
MemoryAgentBench は、データをチャンクに分割してマルチターン対話をシミュレートし、実際の AI アシスタント会話を模倣します。"一度注入して複数回クエリ" の設計で効率を向上させます。ベンチマークは以下の4つのコアコンピテンシーでエージェントを評価します:
- Accurate Retrieval (AR): 記憶から特定情報を正確に取得すること。
- Test-Time Learning (TTL): 対話中に新しい情報を学習すること。
- Long-Range Understanding (LRU): 長距離の文脈を理解すること。
- Conflict Resolution (CR): 矛盾する情報を処理すること。
Who it’s for
LLM エージェント、RAG システム、エージェント型メモリ手法を構築する研究者や開発者で、マルチターンシナリオにおけるモデルの記憶性能と信頼性を定量化したい方々。
Highlights
- Multi-Turn Simulation: データをチャンク化して、現実的な日常会話をシミュレート。
- Diverse Datasets: EventQA や FactConsolidation など新規構築データセットに加え、他ベンチマークから再構成したデータも含む。
- Efficiency: 1つの長文テキストを複数の質問で使用でき、評価コストを削減。
- Comprehensive Metrics: exact match、substring match、Recall@5、LLM-as-judge 評価など多様な指標をサポート。