EleutherAI/lm-evaluation-harness

A framework for few-shot evaluation of language models.

해결하는 문제

이 프로젝트는 광범위한 평가 작업에 걸쳐 생성 언어 모델을 테스트하기 위한 통합 프레임워크를 제공합니다. 다른 모델을 위해 개별적이고 파편화된 벤치마크를 실행할 필요를 없애고, 연구원과 개발자가 표준 학술 벤치마크를 사용하여 LLM 성능을 일관되고 재현 가능하게 비교할 수 있도록 합니다.

작동 방식

이 하네스는 다양한 모델 백엔드와 평가 작업 라이브러리 간의 표준화된 인터페이스 역할을 합니다. Hugging Face transformers, vLLM, NVIDIA NeMo, Megatron-LM 및 상용 API(예: OpenAI)를 포함한 다양한 모델 로딩 방법을 지원합니다. 이 프레임워크를 통해 사용자는 CLI 또는 Python API를 통해 모델, 작업 세트(예: hellaswag) 및 구성 옵션을 지정한 다음, 프롬프트 생성, 모델 추론 및 메트릭 계산을 자동으로 처리할 수 있습니다.

대상 독자

AI 연구원, LLM 개발자 및 조직(예: NVIDIA, Cohere, Mosaic ML)을 위해 설계되었으며, 비교 가능성과 Open LLM Leaderboard와의 일관성을 보장하기 위해 업계 표준 벤치마크에 대해 모델의 기능을 엄격하게 평가할 필요가 있는 사용자를 위한 것입니다.

주요 특징

  • 광범위한 벤치마크 라이브러리: 수백 개의 하위 작업을 포함하는 60개 이상의 표준 학술 벤치마크가 포함되어 있습니다.
  • 폭넓은 모델 지원: Hugging Face, vLLM, Megatron-DeepSpeed, NVIDIA NeMo 및 상용 API와 호환됩니다.
  • 유연한 병렬성: 데이터 병렬 평가, 모델 샤딩(accelerate를 통해) 및 기본 PyTorch Tensor Parallelism을 지원합니다.
  • 사용자 정의 가능성: 사용자 정의 프롬프트, 평가 메트릭 및 YAML 기반 작업 구성을 허용합니다.
  • 멀티모달 프로토타이핑: 텍스트+이미지 멀티모달 입력 작업에 대한 실험적 지원.
  • 업계 표준: Hugging Face Open LLM Leaderboard의 백엔드 역할을 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트