supermemoryai/memorybench

Unified benchmark for evaluating conversational memory and RAG across multiple datasets

解决的问题

MemoryBench 提供了一种标准化的方法,用于评估和比较 AI 的记忆和上下文系统(如 AI 的长期记忆提供者)。它解决了使用一致的数据集和判断标准,对不同记忆提供者进行并行测试的困难,避免了为每个新工具编写自定义评估代码的需要。

工作原理

该框架采用可插拔的流水线,将记忆提供者、基准数据集和判断模型分离。流程遵循以下步骤:

  1. 导入:将基准会话加载到提供者中。
  2. 索引:等待提供者完成数据索引。
  3. 搜索:向提供者查询以检索相关上下文。
  4. 回答:使用指定的 LLM 生成答案。
  5. 评估:判断模型将答案与真实答案进行比较,分配得分。
  6. 报告:将结果汇总为最终报告。

它支持检查点功能,允许用户从上次成功阶段恢复失败的运行,并提供 Web UI 以实时检查失败情况和问题。

适用人群

专为需要在不同提供者之间定量衡量准确率、延迟和令牌使用量的 AI 记忆系统开发者和研究人员设计。

特色亮点

  • 互操作性架构:可自由组合任意支持的提供者、基准数据集和判断模型(例如 GPT-4o、Claude、Gemini)。
  • 多提供者对比:可同时在多个提供者上运行相同基准,进行性能对比。
  • MemScore:一种复合指标,综合衡量质量(准确率)、延迟(毫秒)和上下文令牌,突出性能权衡。
  • 可插拔设计:用户可轻松添加自己的自定义基准、提供者或判断模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目