open-compass/opencompass
OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.
해결하는 문제
OpenCompass는 대규모 언어 모델(LLM) 및 대규모 시각-언어 모델(LVLM)에 대한 통합적이고 공정하며 재현 가능한 평가 플랫폼을 제공합니다. 다양한 분리된 벤치마크를 수동으로 실행할 필요 없이, 다양한 차원에서 모델의 품질과 효과를 종합적으로 평가할 수 있는 통합 시스템을 제공합니다.
작동 방식
OpenCompass는 모듈식 설계를 채택하여 HuggingFace, API, 또는 사용자 정의 인터페이스를 통해 다양한 모델과 데이터셋을 통합할 수 있습니다. 제로샷, 희소샷, 체인오브사고(Chain-of-Thought) 등 다양한 평가 패러다임을 지원하며, CLI 또는 Python 스크립트로 구성할 수 있습니다. 효율성을 위해 10억 규모 모델을 처리할 수 있는 분산 평가를 구현하고, vLLM 및 LMDeploy와 같은 가속 백엔드와 통합됩니다.
대상 사용자
모델을 산업 표준과 비교하거나, 오픈소스 모델과 프로퍼리에타리 API 모델을 비교하거나, 새로운 평가 벤치마크를 개발해야 하는 AI 연구자 및 실무자에게 적합합니다.
주요 특징
- 광범위한 호환성: 약 40만 개의 질문을 포함해 20개 이상의 모델과 70개 이상의 데이터셋을 지원합니다.
- 분산 평가: 작업 분할을 통해 대규모 평가 작업을 몇 시간 내에 완료할 수 있습니다.
- 유연한 평가 패러다임: 제로샷, 희소샷, CoT 평가를 사용자 정의 프롬프트 템플릿과 함께 지원합니다.
- LLM-as-Judge:
GenericLLMEvaluator와 같은 도구를 통해 LLM을 다른 모델 출력을 평가하는 데 활용할 수 있습니다. - 다중 모달 지원: VLMEvalKit과 통합되어 네이티브 다중 모달 데이터셋 로드 및 평가를 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트