HUST-AI-HYZ/MemoryAgentBench

Open source code for ICLR 2026 Paper: Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions

What it solves

它提供一個標準化的基準,用來評估 LLM 代理在增量、多回合互動中處理記憶的能力。它特別針對需要衡量代理在長對話中記住、更新以及解決資訊衝突的能力,而非僅僅處理單一長提示。

How it works

MemoryAgentBench 透過將資料切割成區塊來模擬真實的 AI 助理對話,以模仿多回合互動。它採用「一次注入,多次查詢」的設計以提升效率。此基準在四大核心能力上評估代理:

  • Accurate Retrieval (AR): 從記憶中找出特定資訊。
  • Test-Time Learning (TTL): 在互動過程中學習新資訊。
  • Long-Range Understanding (LRU): 理解長距離的上下文。
  • Conflict Resolution (CR): 處理相互矛盾的資訊。

Who it’s for

研究人員與開發者,尤其是構建 LLM 代理、RAG 系統或代理記憶方法的團隊,需要在多回合情境下量化模型的記憶效能與可靠性。

Highlights

  • Multi-Turn Simulation: 資料被切割成區塊,以模擬真實的日常對話。
  • Diverse Datasets: 包含新建的資料集,如 EventQA 與 FactConsolidation,並結合其他基準重新整理的資料。
  • Efficiency: 同一段長文本可用於多個問題,降低評估開銷。
  • Comprehensive Metrics: 支援多種指標,包括 exact match、substring match、Recall@5,以及 LLM-as-judge 評估。