supermemoryai/memorybench

Unified benchmark for evaluating conversational memory and RAG across multiple datasets

해결하는 문제

MemoryBench는 AI의 장기 메모리 제공자와 같은 메모리 및 컨텍스트 시스템을 평가하고 비교할 수 있는 표준화된 방법을 제공합니다. 일관된 데이터셋과 평가 기준을 사용하여 다양한 메모리 제공자를 동시에 테스트하는 어려움을 해결하며, 새로운 도구마다 맞춤형 평가 코드를 작성할 필요 없이 효율적으로 평가할 수 있습니다.

작동 방식

이 프레임워크는 메모리 제공자, 벤치마크 데이터셋, 판단 모델을 분리하는 플러그인식 파이프라인을 사용합니다. 프로세스는 다음과 같은 단계를 따릅니다:

  1. 인제스트: 벤치마크 세션을 제공자에 로드합니다.
  2. 인덱스: 제공자가 데이터를 인덱싱할 때까지 대기합니다.
  3. 검색: 제공자에게 관련 컨텍스트를 검색합니다.
  4. 응답: 지정된 LLM을 사용하여 답변을 생성합니다.
  5. 평가: 판단 모델이 답변을 정답과 비교하여 점수를 부여합니다.
  6. 보고: 결과를 집계하여 최종 보고서를 생성합니다.

체크포인트 기능을 통해 실패한 실행을 마지막 성공 단계에서 재시작할 수 있으며, 실시간으로 실패 사례와 질문을 확인할 수 있는 웹 UI도 제공됩니다.

대상 사용자

다양한 제공자 간 정확도, 지연 시간, 토큰 사용량을 정량적으로 측정해야 하는 AI 메모리 시스템을 개발하거나 통합하는 개발자 및 연구자를 대상으로 합니다.

주요 기능

  • 상호 운용성 아키텍처: 지원되는 어떤 제공자, 벤치마크 데이터셋, 판단 모델도 자유롭게 조합 가능 (예: GPT-4o, Claude, Gemini).
  • 다중 제공자 비교: 동일한 벤치마크를 여러 제공자에서 동시에 실행하여 성능을 비교할 수 있습니다.
  • MemScore: 정확성, 지연 시간(ms), 컨텍스트 토큰을 통합한 복합 지표로 성능 트레이드오프를 명확히 드러냅니다.
  • 플러그인 설계: 사용자는 자신의 커스텀 벤치마크, 제공자, 판단 모델을 쉽게 추가할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트