허깅 페이스 커뮤니티 Evals과 Every Eval Ever (EEE) 통합
허깅 페이스 커뮤니티 Evals과 Every Eval Ever (EEE) 통합
커뮤니티 Evals과 Every Eval Ever (EEE) 통합
허깅 페이스는 허깅 페이스 커뮤니티 Evals과 Every Eval Ever (EEE) 간의 상호 호환성을 활성화하여, 두 플랫폼 모두에서 평가 결과를 교차 게시하고 해석할 수 있도록 했습니다. 이 통합은 오픈 모델과 리더보드를 통합된 표준화된 메타데이터 저장소와 연결하여 AI 평가 보고서의 fragmentation 문제를 해결합니다.
평가 보고서 갭 해결
AI 평가 결과는 현재 논문, 블로그 글, 리더보드에 흩어져 있으며, 종종 일관되지 않은 형식을 사용합니다. 이러한 표준화 부족은 동일한 모델이 동일한 벤치마크에서도 평가자 및 사용된 설정에 따라 다른 점수를 보고하게 만드는 차이를 초래합니다. 예를 들어, LLaMA 65B는 MMLU 점수가 63.7과 48.8 두 가지로 보고된 바 있습니다.
이를 해결하기 위해, 2026년 2월에 EvalEval Coalition이 출시한 Every Eval Ever (EEE) 프로젝트는 평가 결과를 위한 단일 JSON 스키마를 제공합니다. 이 스키마는 다음과 같은 중요한 메타데이터를 기록합니다:
- 평가자의 신원
- 사용된 모델
- 접근 방법
- 생성 설정
- 메트릭의 정의
- per-sample 출력을 위한 선택적 동반 JSONL 파일
2026년 6월 기준으로, 허깅 페이스의 EEE 데이터스토어에는 약 229,000개의 평가 결과가 포함되어 있으며, 이는 22,000개 이상의 모델과 2,200개의 벤치마크를 다루며, 31가지不同的 보고 형식에서 파생되었습니다.
커뮤니티 Evals과 EEE가 함께 작동하는 방식
커뮤니티 Evals과 EEE는 모델 평가 생태계에서 보완적인 역할을 합니다: 허깅 페이스는 사용자가 모델을 발견할 수 있는 가시성 레이어를 제공하고, EEE는 전체 기술 기록을 포함하는 해석 가능 레이어를 제공합니다.
허깅 페이스 커뮤니티 Evals
커뮤니티 Evals은 두 가지 메커니즘을 통해 허브에서 벤치마크 보고를 분산화합니다:
- 벤치마크 등록: 벤치마크는
eval.yaml파일이 있는 데이터세트 리포지토리에 존재하며, 이 파일을 통해 허브 전체에서 해당 벤치마크에 보고된 모든 점수의 리더보드가 생성됩니다. - 모델 점수 보고: 점수는 모델 리포지토리 내의
.eval_results/*.yaml파일에 YAML 파일로 저장됩니다. 이러한 점수는 모델 카드에 나타나고 벤치마크 리더보드에 피드됩니다. 결과는 모델 작성자, 풀 리퀘스트를 통한 커뮤니티, 또는 독립 검증자에 의해 제출될 수 있습니다.
통합 레이어
결과가 두 플랫폼 모두로 전송될 때, 점수는 허깅 페이스 모델 페이지와 벤치마크 리더보드에 나타나지만, 소스 배지가 포함됩니다. 이 배지는 전체 EEE JSON 레코드로 직접 연결되어, 생성 구성, 하네스 버전, 재현 가능성 노트에 대한 접근을 제공합니다.
기술 구현 및 컨버터 도구
프로세스를 간소화하기 위해, 허깅 페이스는 EEE 레코드를 커뮤니티 Evals에 필요한 YAML 형식으로 변환하는 컨버터를 도입했습니다.
매핑 및 지원되는 벤치마크
컨버터는 특정 EEE 필드를 커뮤니티 Evals YAML 필드에 매핑합니다:
source_data.hf_repo$ ightarrow$dataset.idevaluation_name$ ightarrow$task_idscore_details.score$ ightarrow$valueevaluation_timestamp$ ightarrow$date
이 도구는 현재 네 가지 공식 벤치마크를 지원합니다: MMLU-Pro, GPQA, HLE, 및 GSM8K.
워크플로 및 검증
컨버터는 단순히 데이터를 재구성하는 것이 아니라, 변경 사항을 푸시하기 전에 일련의 감사를 수행합니다:
- 데이터 검색: 지정된 EEE 데이터스토어 컬렉션을 다운로드하고 객체 해시를 검증합니다.
- 감사: 모델의 메인 브랜치와 오픈 PR에 존재하는
.eval_resultsYAML을 읽어 기존 점수를 확인합니다. - 충돌 감지: 결과는
already_present,score_conflict(다른 점수가 존재하는 경우), 또는missing_hf_model(허브에서 리포지토리를 해결할 수 없는 경우)로 플래그가 지정됩니다. 유효한 항목은ready로 표시됩니다. - 사람 승인: 데이터는 자동으로 푸시되지 않습니다. 도구는 로컬 YAML 미리보기와 검토 파일을 생성합니다. 사용자가
OPEN PRS를 명시적으로 입력하고 커밋 메시지를 제공한 후에만 PR이 열립니다.
시작하기
연구자와 평가자는 EEE 데이터스토어에 전체 레코드를 제출하여 기여할 수 있습니다. 허깅 페이스에 제출을 자동화하기 위해, every_eval_ever GitHub 리포지토리에서 이용 가능한 커뮤니티 Evals 컨버터 도구를 다음 명령어를 사용하여 사용할 수 있습니다:
uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro --datastore evaleval/EEE_datastore@main
요약: 허깅 페이스는 표준화된 평가 결과를 교차 게시하고 모델 페이지와 상세 기술 기록 간의 직접 연결을 가능하게 하기 위해 커뮤니티 Evals과 Every Eval Ever (EEE) 프로젝트를 통합했습니다.