supermemoryai/memorybench
Unified benchmark for evaluating conversational memory and RAG across multiple datasets
解決的問題
MemoryBench 提供了一種標準化的方式,用於評估和比較 AI 的記憶與上下文系統(例如 AI 的長期記憶提供者)。它解決了使用一致的資料集與判斷標準,並行測試不同記憶提供者的困難,避免了為每個新工具撰寫自訂評估程式碼的需要。
工作原理
此框架使用可插入的流程,將記憶提供者、基準資料集與判斷模型分離。流程遵循以下步驟:
- 載入:將基準會話載入提供者。
- 索引:等待提供者完成資料索引。
- 搜尋:向提供者查詢以取得相關上下文。
- 回應:使用指定的 LLM 產生答案。
- 評估:判斷模型將答案與真實答案比較,並賦予分數。
- 報告:將結果匯總為最終報告。
支援檢查點功能,允許使用者從上次成功階段恢復失敗的執行,並提供 Web UI 以即時檢視失敗與問題。
適用對象
專為需要在不同提供者之間定量衡量準確率、延遲與 Token 使用量的 AI 記憶系統開發者與研究人員設計。
特色亮點
- 互操作性架構:可自由組合任意支援的提供者、基準資料集與判斷模型(例如 GPT-4o、Claude、Gemini)。
- 多提供者比較:可同時在多個提供者上執行相同基準,進行性能對比。
- MemScore:一種綜合指標,整合品質(準確率)、延遲(毫秒)與上下文 Token,突顯性能權衡。
- 可插入設計:使用者可輕鬆新增自己的自訂基準、提供者或判斷模型。
相關
- 專案
- 專案
- 專案
- 專案
- 專案