Hugging Face 커뮤니티 평가

Hugging Face는 Community Evals를 출시했습니다. 이는 벤치마크 데이터셋이 리더보드를 호스팅하고 모델이 자체 평가 점수를 저장할 수 있게 하는 분산 프레임워크입니다. 이 시스템은 커뮤니티가 풀 리퀘스트를 통해 결과를 제출하고 검증하도록 함으로써 모델 성능에 대한 단일 진실 원천이 없다는 문제를 해소하고자 합니다.

분산 평가 보고

Hugging Face는 Hub에서 평가 보고를 위한 분산 모델로 전환하고 있습니다. 중앙 집중식 블랙박스 리더보드에 의존하는 대신, 시스템은 커뮤니티가 벤치마크 점수를 공개적으로 보고할 수 있게 합니다. 초기 롤아웃은 네 개의 벤치마크를 대상으로 시작되며, 시간이 지나면서 더 많은 관련 벤치마크로 확대될 계획입니다.

벤치마크 데이터셋용

데이터셋 저장소는 이제 벤치마크(이미 MMLU‑Pro, GPQA, HLE가 활성화됨)로 등록할 수 있습니다. 이러한 저장소는 Hub 전역에서 보고된 결과를 자동으로 집계하여 데이터셋 카드 내에 리더보드를 표시합니다. 재현성을 보장하기 위해 벤치마크는 Inspect AI 형식을 기반으로 한 eval.yaml 파일을 통해 평가 사양을 정의합니다.

모델 저장소용

평가 점수는 모델 저장소의 .eval_results/ 디렉터리 안에 YAML 파일 형태로 저장됩니다. 이 점수들은 모델 카드에 표시되며 벤치마크 데이터셋에 전달됩니다. 시스템은 모델 작성자가 제공한 결과와 공개 풀 리퀘스트를 통해 제출된 결과를 모두 집계합니다.

커뮤니티를 위해

사용자는 누구든지 풀 리퀘스트를 통해 어떤 모델에 대한 평가 결과도 제출할 수 있습니다. 이러한 결과는 모델 작성자가 PR을 병합하지 않아도 "community" 점수로 표시됩니다. 사용자는 연구 논문, 모델 카드, 서드파티 평가 플랫폼, 혹은 inspect 평가 로그와 같은 증거 자료에 링크할 수 있습니다. Hub가 Git 기반이기 때문에 모든 평가 추가 및 변경 사항은 투명한 히스토리를 통해 추적됩니다.

평가 격차 해소

Community Evals는 현재 AI 평가 환경에서 두 가지 주요 격차를 해결합니다:

  1. The Performance Gap: 높은 벤치마크 점수(예: MMLU 91% 이상, GSM8K 94% 이상, HumanEval "정복" 수준)와 웹 브라우징, 프로덕션 코딩, 다단계 추론과 같은 실제 작업에서의 성능 사이에 문서화된 괴리가 존재합니다.
  2. The Reporting Gap: 모델 카드, 연구 논문, 다양한 평가 플랫폼에 보고된 점수 간에 불일치가 자주 발생하여 통합된 진실 원천이 부족합니다.

AI 생태계에 대한 함의

Hub API를 통해 기존 점수를 공개함으로써 커뮤니티는 분야 전반에 걸친 성능을 보다 쉽게 집계하고 추적하여 맞춤형 대시보드와 리더보드를 구축할 수 있습니다. Hugging Face는 이 시스템이 벤치마크 포화 문제를 해결하거나 테스트 세트에 대한 학습을 방지하지는 못한다는 점을 인정하지만, 무엇이 평가되고, 어떻게 수행되며, 누가 평가하는지에 대한 가시성을 높입니다.

궁극적인 목표는 Hub를 재현 가능한 벤치마크를 공유하는 활발한 환경으로 전환하는 것입니다. 특히 최신 모델에 도전하는 새로운 작업과 도메인에 초점을 맞춥니다.

SUMMARY: Hugging Face는 Community Evals를 도입했습니다. 이는 Hub에서 직접 모델 벤치마크 점수를 보고하고 집계하는 분산 시스템으로, 투명성과 재현성을 높입니다.

TITLE: Hugging Face 커뮤니티 평가

Sources