open-compass/opencompass
OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.
What it solves
OpenCompass는 대규모 언어 모델(LLMs) 및 대규모 비전‑언어 모델을 평가하기 위한 통합되고 공정하며 재현 가능한 플랫폼을 제공합니다. 다양한 벤치마크를 수동으로 관리하는 복잡성을 없애고, 방대한 데이터셋 라이브러리를 활용해 여러 차원에서 모델 품질을 평가하는 원스톱 시스템입니다.
How it works
플랫폼은 명령줄 인터페이스(CLI) 또는 Python 스크립트를 통해 평가를 실행할 수 있습니다. HuggingFace, vLLM, LMDeploy 등 다양한 추론 백엔드와 통합되어 모델 실행을 처리하며, 제로샷, Few‑Shot, Chain‑of‑Thought(CoT) 등 여러 평가 패러다임을 지원합니다. 오픈소스 모델과 API 기반 모델(GPT-4o 등)을 동일하게 다룰 수 있습니다. 복잡한 평가를 위해서는 커스텀 평가자와 순차 평가 파이프라인(CascadeEvaluator)을 지원하는 모듈식 설계를 사용합니다.
Who it’s for
NLP 모델의 성능을 벤치마크하고, 표준화된 리더보드에서 다양한 LLM을 비교하거나, 특정 모델의 추론, 지식, 장문 컨텍스트 작업 능력을 검증하려는 AI 연구자와 엔지니어를 위해 설계되었습니다.
Highlights
- Extensive Library: 20개 이상의 모델과 70개 이상의 데이터셋을 사전 지원하며, 약 40만 개의 질문을 포함합니다.
- Distributed Evaluation: 원클릭으로 분산 작업을 나누어 수시간 안에 수십억 규모 모델을 평가할 수 있습니다.
- Flexible Inference: vLLM 및 LMDeploy와 같은 가속 백엔드를 원클릭으로 전환할 수 있습니다.
- Diverse Paradigms: 제로샷, Few‑Shot, CoT 평가를 지원하고 프롬프트 템플릿을 커스터마이징할 수 있습니다.
- LLM-as-Judge:
GenericLLMEvaluator와 같은 도구를 포함하여 LLM을 사용해 다른 모델의 출력을 평가합니다.