groq/openbench

Provider-agnostic, open-source evaluation infrastructure for language models

해결하는 문제

openbench는 대규모 언어 모델(LLM)을 평가하기 위한 프로바이더에 종속되지 않는 오픈소스 인프라입니다. 다양한 모델 제공업체에 얽매이지 않고, 다양한 작업에 대해 표준화되고 재현 가능한 방식으로 모델을 테스트할 수 있도록, 분산되고 일관성 없는 평가 프로세스 문제를 해결합니다.

작동 방식

Inspect AI 프레임워크 위에 구축된 openbench는 MMLU, GPQA, HumanEval을 포함한 95개 이상의 벤치마크를 커리레이티드 라이브러리로 제공하며, 간단한 CLI 도구(bench)를 통해 실행할 수 있습니다. Groq, OpenAI, Anthropic 및 Ollama와 같은 로컬 옵션을 포함해 30개 이상의 모델 제공업체를 지원하여, API 키나 로컬 설정을 통해 동일한 평가 스위트를 다양한 모델에 적용할 수 있습니다. 또한 사용자가 로컬 평가 파일에 직접 연결할 수 있도록 하여 사적 평가도 가능합니다.

대상 사용자

수학, 코딩, 추론과 같은 다양한 분야에서 LLM 성능을 평가하고, 일관된 방법론을 사용해 다양한 제공업체의 모델을 비교하고자 하는 AI 개발자 및 연구자에게 적합합니다.

주요 특징

  • 광범위한 프로바이더 지원: 30개 이상의 모델 제공업체를 즉시 지원합니다.
  • 풍부한 벤치마크 라이브러리: 지식, 과학, 장문 컨텍스트 재현을 포함한 95개 이상의 벤치마크를 포함합니다.
  • 간편한 CLI: 벤치마크 목록 조회, 실행, 결과 확인을 위한 간결한 명령어를 제공합니다.
  • 확장 가능한 아키텍처: Python 엔트리 포인트를 통한 플러그인 시스템으로 사용자 정의 벤치마크를 패키지 형태로 배포할 수 있습니다.
  • Hugging Face 통합: 평가 결과를 직접 Hugging Face 데이터셋에 푸시할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트