HUST-AI-HYZ/MemoryAgentBench

Open source code for ICLR 2026 Paper: Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

What it solves

점진적이고 다회전 상호작용에서 LLM 에이전트가 메모리를 얼마나 잘 다루는지 평가하기 위한 표준화된 벤치마크를 제공합니다. 단일 긴 프롬프트를 처리하는 것이 아니라, 긴 대화 동안 제공된 정보를 기억하고, 업데이트하며, 충돌을 해결하는 능력을 측정해야 하는 필요성을 해결합니다.

How it works

MemoryAgentBench는 데이터를 청크로 나누어 실제 AI 어시스턴트 대화를 시뮬레이션함으로써 다회전 상호작용을 모방합니다. "한 번 주입하고 여러 번 질의" 설계로 효율성을 높였습니다. 벤치마크는 네 가지 핵심 역량을 기준으로 에이전트를 평가합니다:

  • Accurate Retrieval (AR): 메모리에서 특정 정보를 정확히 찾아내는 것.
  • Test-Time Learning (TTL): 상호작용 중 새로운 정보를 학습하는 것.
  • Long-Range Understanding (LRU): 장거리 컨텍스트를 이해하는 것.
  • Conflict Resolution (CR): 모순되는 정보를 처리하는 것.

Who it’s for

LLM 에이전트, RAG 시스템 또는 에이전트형 메모리 방법을 구축하는 연구자와 개발자들로, 다회전 시나리오에서 모델의 메모리 성능과 신뢰성을 정량화하고자 하는 분들을 위한 것입니다.

Highlights

  • Multi-Turn Simulation: 데이터를 청크화하여 현실적인 일상 대화를 시뮬레이션합니다.
  • Diverse Datasets: EventQA와 FactConsolidation 같은 신규 데이터셋과 다른 벤치마크에서 재구성한 데이터를 포함합니다.
  • Efficiency: 하나의 긴 텍스트를 여러 질문에 사용할 수 있어 평가 비용을 줄입니다.
  • Comprehensive Metrics: exact match, substring match, Recall@5, LLM-as-judge 평가 등 다양한 메트릭을 지원합니다.