HUST-AI-HYZ/MemoryAgentBench

Open source code for ICLR 2026 Paper: Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

What it solves

它提供一个标准化的基准,用来评估 LLM 代理在增量、多轮交互中处理记忆的能力。它特别针对需要衡量代理在长对话中记住、更新以及解决信息冲突的能力,而非仅仅处理单一长提示。

How it works

MemoryAgentBench 通过将数据切分成块来模拟真实的 AI 助手对话,以模仿多轮交互。它采用“一次注入,多次查询”的设计以提升效率。此基准在四大核心能力上评估代理:

  • Accurate Retrieval (AR): 从记忆中找出特定信息。
  • Test-Time Learning (TTL): 在交互过程中学习新信息。
  • Long-Range Understanding (LRU): 理解长距离的上下文。
  • Conflict Resolution (CR): 处理相互矛盾的信息。

Who it’s for

研究人员与开发者,尤其是构建 LLM 代理、RAG 系统或代理记忆方法的团队,需要在多轮情境下量化模型的记忆性能与可靠性。

Highlights

  • Multi-Turn Simulation: 数据被切分成块,以模拟真实的日常对话。
  • Diverse Datasets: 包含新建的数据集,如 EventQA 与 FactConsolidation,并结合其他基准重新整理的数据。
  • Efficiency: 同一段长文本可用于多个问题,降低评估开销。
  • Comprehensive Metrics: 支持多种指标,包括 exact match、substring match、Recall@5,以及 LLM-as-judge 评估。