modelscope/evalscope

A streamlined and customizable framework for efficient large model (LLM, VLM, AIGC) evaluation and performance benchmarking.

해결하는 문제

EvalScope는 대규모 언어 모델(LLM) 및 기타 AI 모델의 평가를 단순화하기 위해 설계된 포괄적인 프레임워크입니다. 모델 역량을 측정하고, 스트레스 상황에서의 추론 성능을 테스트하며, 결과를 시각화할 수 있는 통합 인터페이스를 제공하여 여러 이질적인 평가 도구를 실행해야 하는 번거로움을 제거합니다.

작동 방식

EvalScope는 여러 백엔드(OpenCompass, VLMEvalKit, RAGEval 등)와 방대한 산업 표준 벤치마크 라이브러리(MMLU, C-Eval, GSM8K 등)를 통합하는 원스톱 평가 허브 역할을 합니다. OpenAI 호환 API 또는 로컬 모델 파일을 통한 모델 평가를 지원합니다. 고급 유스케이스를 위해 Docker 샌드박스와 플러그형 전략을 사용하여 제어된 멀티턴 루프 내에서 벤치마크를 실행하는 "Agent Evaluation Mode"를 포함합니다. 또한 Time to First Token (TTFT) 및 Time Per Output Token (TPOT)과 같은 지표를 측정하기 위한 성능 테스트 모듈도 포함되어 있습니다.

대상 사용자

이 도구는 평가 파이프라인을 표준화하거나, 다양한 도메인에서 서로 다른 모델을 비교하거나, 프로덕션 준비를 위해 모델 서비스의 스트레스 테스트가 필요한 AI 개발자, 연구자 및 모델 제공자를 위한 것입니다.

주요 특징

  • 폭넓은 모델 지원: LLM, Vision Language Models (VLM), Embeddings, Rerankers 및 AIGC 모델을 평가합니다.
  • Agentic Evaluation: SWE-bench와 같은 벤치마크를 위해 전체 트레이스 기록 및 시각화가 포함된 멀티턴 에이전트 루프를 지원합니다.
  • uma Arena Mode: 모델 간의 쌍체 대결(pairwise battles)을 가능하게 하여 직관적으로 순위를 매깁니다.
  • 성능 스트레스 테스트: 모델 서비스의 추론 효율성 및 처리량을 측정합니다.
  • 대화형 대시보드: 다차원 모델 비교 및 상세 예측 검사를 위한 React 기반 WebUI.
  • 확장 가능한 아키텍처: 개발자가 사용자 정의 데이터셋, 모델 및 지표를 쉽게 추가할 수 있도록 합니다.