modelscope/evalscope

A streamlined and customizable framework for efficient large model (LLM, VLM, AIGC) evaluation and performance benchmarking.

EvalScope – LLM 및 멀티모달 모델을 위한 원스톱 평가 플랫폼

개요 – EvalScope는 대규모 언어 모델, 비전-언어 모델, 임베딩/리랭커 서비스, 그리고 자율 에이전트에 이르기까지 다양한 벤치마크를 실행할 수 있는 Python 패키지입니다. 단일 CLI 명령(또는 몇 줄의 Python 코드)으로 다음을 수행할 수 있습니다:

  • 모델 능력 평가 – MMLU, C-Eval, GSM8K, ARC 등의 고전적인 텍스트 벤치마크와 수십 개의 최신 멀티모달, 코드 생성, RAG, 에이전트 중심 스위트를 실행합니다.
  • 추론 스트레스 테스트 – 모델이 요청을 처리하는 동안 지연 시간, 첫 토큰까지의 시간, 처리량 등의 성능 수치를 측정합니다.
  • 에이전트 실행 – 벤치마크를 다중 턴 AgentLoop로 래핑하여 도구(bash, python, 웹 검색, Docker 샌드박스 등)를 호출하고 각 샘플의 전체 추적을 기록할 수 있습니다.
  • 모델 비교 – 대화형 웹 대시보드가 점수, 샘플별 예측, 성능 메트릭을 시각화하고 쌍별 "아레나" 배틀을 지원합니다.
  • 플러그인 가능한 확장 – 몇 줄의 구성으로 자체 데이터셋, 모델, 메트릭 또는 백엔드(OpenCompass, VLMEvalKit, RAGEval 등)를 추가할 수 있습니다.

핵심 기능(README에 명시)

기능 제공 내용
포괄적인 벤치마크 수십 개의 업계 표준 스위트(MMLU, C-Eval, GSM8K, MathVista, VQA, 코드 벤치마크, RAG, 에이전트 벤치마크 등)에 대한 내장 지원.
멀티모달 및 멀티도메인 순수 LLM, 비전-언어 모델, 임베딩 서비스, 리랭커, 생성 AIGC 모델에서 작동.
멀티백엔드 통합 글루 코드를 작성하지 않고 OpenCompass, VLMEvalKit, RAGEval 및 기타 타사 평가 도구를 호출.
에이전트 평가 모드 플러그 가능한 전략, 도구, Docker 샌드박스를 갖춘 제어 가능한 AgentLoop 내에서 벤치마크를 실행하고 상세한 agent_trace를 기록.
추론 성능 테스트 TTFT, TPOT, 처리량을 보고하고 다중 턴 대화를 시뮬레이션할 수 있는 스트레스 테스트 유틸리티.
대화형 웹 대시보드 모델 비교, 점수 테이블, 샘플별 예측, 에이전트 추적 시각화를 위한 React/Vite UI.
아레나 모드 여러 모델 간의 쌍별 배틀을 자동으로 순위 매김.
확장성 간단한 등록 API를 통해 사용자 정의 데이터셋, 모델, 메트릭 또는 전체 백엔드를 추가.

일반적인 워크플로(빠른 시작)

# 패키지 설치
pip install evalscope

# 원격 OpenAI 호환 API 평가(GPU 불필요)
# – GSM8K 및 ARC 벤치마크 선택, 각 5개 샘플 실행

evalscope eval \
  --model your-model-name \
  --api-url $OPENAI_API_BASE_URL \
  --api-key $OPENAI_API_KEY \
  --eval-type openai_api \
  --datasets gsm8k arc \
  --limit 5

또는 Python에서:

from evalscope import run_task, TaskConfig

cfg = TaskConfig(
    model='your-model-name',
    api_url='https://my-endpoint/v1',
    api_key='my_key',
    eval_type='openai_api',
    datasets=['gsm8k', 'arc'],
    limit=5,
)
run_task(cfg)   # CLI와 동일

명령은 모델 서비스에 연결하고 선택한 벤치마크를 실행하며 정확도 점수 성능 수치를 수집하고 마지막으로 결과를 탐색할 수 있는 로컬 웹 UI를 시작합니다.


EvalScope를 누가 사용해야 하나요?

  • 모델 개발자 – 새로운 LLM 또는 VLM을 수십 개의 공개 데이터셋에 대해 신속하게 벤치마킹하고 어디에서 뒤처지는지 확인.
  • 운영/플랫폼 팀 – 모델 서빙 엔드포인트에 대한 스트레스 테스트를 실행하여 지연 시간 및 처리량 SLA를 검증.
  • 연구소 – 내장된 다중 턴 루프로 에이전트 행동(도구 호출, ReAct, 코드 생성)을 평가하고 분석용 추적을 기록.
  • 제품 팀 – 대시보드에서 여러 후보 모델을 나란히 비교하여 데이터 기반 선택을 수행.

설치 및 문서


결론 – EvalScope는 광범위한 AI 모델의 정확도, 속도, 에이전트 능력을 포괄하는 성숙하고 활발히 유지 관리되는 평가 프레임워크로, 사용자 친화적인 CLI와 시각적 대시보드로 제공됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트