open-compass/opencompass

OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.

해결하는 문제

OpenCompass는 대규모 언어 모델(LLM) 및 대규모 시각-언어 모델(LVLM)에 대한 통합적이고 공정하며 재현 가능한 평가 플랫폼을 제공합니다. 다양한 분리된 벤치마크를 수동으로 실행할 필요 없이, 다양한 차원에서 모델의 품질과 효과를 종합적으로 평가할 수 있는 통합 시스템을 제공합니다.

작동 방식

OpenCompass는 모듈식 설계를 채택하여 HuggingFace, API, 또는 사용자 정의 인터페이스를 통해 다양한 모델과 데이터셋을 통합할 수 있습니다. 제로샷, 희소샷, 체인오브사고(Chain-of-Thought) 등 다양한 평가 패러다임을 지원하며, CLI 또는 Python 스크립트로 구성할 수 있습니다. 효율성을 위해 10억 규모 모델을 처리할 수 있는 분산 평가를 구현하고, vLLM 및 LMDeploy와 같은 가속 백엔드와 통합됩니다.

대상 사용자

모델을 산업 표준과 비교하거나, 오픈소스 모델과 프로퍼리에타리 API 모델을 비교하거나, 새로운 평가 벤치마크를 개발해야 하는 AI 연구자 및 실무자에게 적합합니다.

주요 특징

  • 광범위한 호환성: 약 40만 개의 질문을 포함해 20개 이상의 모델과 70개 이상의 데이터셋을 지원합니다.
  • 분산 평가: 작업 분할을 통해 대규모 평가 작업을 몇 시간 내에 완료할 수 있습니다.
  • 유연한 평가 패러다임: 제로샷, 희소샷, CoT 평가를 사용자 정의 프롬프트 템플릿과 함께 지원합니다.
  • LLM-as-Judge: GenericLLMEvaluator와 같은 도구를 통해 LLM을 다른 모델 출력을 평가하는 데 활용할 수 있습니다.
  • 다중 모달 지원: VLMEvalKit과 통합되어 네이티브 다중 모달 데이터셋 로드 및 평가를 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트