LiveBench/LiveBench
LiveBench: A Challenging, Contamination-Free LLM Benchmark
해결하는 문제
LiveBench는 LLM 벤치마크의 테스트 세트 오염 문제를 해결합니다. 기존 벤치마크에서는 모델이 학습 단계에서 테스트 질문을 이미 접했을 수 있어 성능 점수가 부풀려지는 경우가 있습니다. LiveBench는 지속적으로 업데이트되는 도전적인 질문 세트를 제공하여 평가가 객관적이고 신뢰할 수 있도록 보장합니다.
작동 방식
LiveBench는 매달 새로운 질문을 공개하고 최근 출시된 데이터셋, arXiv 논문, 뉴스 기사, IMDb 영화 시놉시스에서 작업을 가져옴으로써 오염을 제한합니다. 많은 벤치마크가 LLM 기반 판정자에 의존하는 것과 달리, LiveBench는 자동으로 점수를 매길 수 있는 검증 가능하고 객관적인 정답(ground-truth)을 사용합니다. 현재 추론, 수학, 코딩, 언어, 데이터 분석, 지시 이행의 6개 카테고리에 걸친 18개의 다양한 작업을 다룹니다.
대상
오염 위험 없이 대규모 언어 모델(LLM)의 성능을 객관적으로 평가해야 하는 AI 연구자 및 개발자를 위해 설계되었습니다.
주요 특징
- 오염 없는 설계: 매달 업데이트와 최신 실제 데이터를 사용하여 학습 데이터셋보다 앞서 나갑니다.
- 객관적 스코어링: 정답(ground-truth)을 사용하여 자동 스코어링을 수행하므로 LLM 판정자가 필요하지 않습니다.
- 다양한 작업 세트: 에이전트 코딩 작업(Docker를 사용하여 실행)을 포함한 폭넓은 능력을 다룹니다.
- 유연한 평가 파이프라인: OpenAI 호환 API, 다양한 모델 제공업체(Anthropic, Cohere, Mistral 등) 및 tmux를 통한 병렬 평가를 지원합니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트