supermemoryai/memorybench

Unified benchmark for evaluating conversational memory and RAG across multiple datasets

解決的問題

MemoryBench 提供了一種標準化的方式,用於評估和比較 AI 的記憶與上下文系統(例如 AI 的長期記憶提供者)。它解決了使用一致的資料集與判斷標準,並行測試不同記憶提供者的困難,避免了為每個新工具撰寫自訂評估程式碼的需要。

工作原理

此框架使用可插入的流程,將記憶提供者、基準資料集與判斷模型分離。流程遵循以下步驟:

  1. 載入:將基準會話載入提供者。
  2. 索引:等待提供者完成資料索引。
  3. 搜尋:向提供者查詢以取得相關上下文。
  4. 回應:使用指定的 LLM 產生答案。
  5. 評估:判斷模型將答案與真實答案比較,並賦予分數。
  6. 報告:將結果匯總為最終報告。

支援檢查點功能,允許使用者從上次成功階段恢復失敗的執行,並提供 Web UI 以即時檢視失敗與問題。

適用對象

專為需要在不同提供者之間定量衡量準確率、延遲與 Token 使用量的 AI 記憶系統開發者與研究人員設計。

特色亮點

  • 互操作性架構:可自由組合任意支援的提供者、基準資料集與判斷模型(例如 GPT-4o、Claude、Gemini)。
  • 多提供者比較:可同時在多個提供者上執行相同基準,進行性能對比。
  • MemScore:一種綜合指標,整合品質(準確率)、延遲(毫秒)與上下文 Token,突顯性能權衡。
  • 可插入設計:使用者可輕鬆新增自己的自訂基準、提供者或判斷模型。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案