EvalEval와 UK AISI, 프론티어 LLM 벤치마크를 위한 개방형 평가 카드 발표
TL;DR
EvalEval와 UK AI 보안 연구소(AISI)는 HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 등 다섯 가지 주목받는 벤치마크에 대한 공개 검증된 평가 카드를 발표했다. 이 카드들은 여섯 가지 프론티어 LLM을 다루며, 재현 가능한 평가를 위해 필요한 전체 구성, 컴퓨팅 자원, 프로토콜 세부 정보를 제공한다.
재현 가능한 평가 보고의 중요성
재현 가능성은 평가 결과가 모델 성능과 안전성에 대한 주요 증거로 점점 더 중요해짐에 따라 필수적이다. 현재의 보고 방식은 형식과 플랫폼이 분산되어 있으며, 추론 컴퓨팅, 평가 프로토콜, 데이터 분할과 같은 핵심 세부 정보를 종종 누락하고 있어 실험을 재실행하는 데 비용이 지나치게 높다. EvalEval은 두 가지 핵심 자산을 통해 이 격차를 메운다:
- Every Eval Ever (EEE) 스키마 – 벤치마크 메타데이터, 모델 메타데이터, 런타임 파라미터를 위한 공유되고 기계가 읽을 수 있는 사양.
- 평가 카드 – EEE 호환 기록을 저장하는 개방형 포털로, 점수를 정확한 실험 설정과 연결한다.
AISI의 효율적이고 통계적으로 엄격한 평가에 관한 연구(예: OptStop, HiBayES)와 함께, 이 협력은 보고의 격차를 진단하고 투명한 평가를 위한 표준화된 인프라를 제공하는 것을 목표로 한다.
AISI가 공유하는 내용
AISI는 최근 논문 How Inference Compute Shapes Frontier LLM Evaluation (arXiv:2606.17930)에 나와 있는 다섯 가지 벤치마크에 대한 평가 카드를 업로드했다. 각 카드에는 다음이 포함된다:
- 각 벤치마크에 대한 검증된 점수.
- 모델 버전(Claude Opus 4, 4.5, 4.6; GPT-5, 5.2, 5.4), 추론 시 컴퓨팅 예산, 토큰 제한, 평가 프로토콜을 포함한 전체 맥락.
- 프롬프트 템플릿, 샘플링 설정, 오라클 피드백 메커니즘과 같은 구성 세부 정보.
또한 모델 세트가 부분적으로 겹치는 두 가지 보조 사이버보안 평가(Cyber CTFs 및 The Last Ones)도 포함되어 있다. 이러한 세부 정보를 공개함으로써 연구자들은:
- 컴퓨팅 또는 프로토콜의 변화가 성능에 미치는 영향을 분석할 수 있다(예: Humanity’s Last Exam의 토큰 효율성 곡선).
- 수치적으로 유사해 보이지만 다른 조건에서 얻어진 연구 간 결과를 비교할 수 있다.
- 메타연구 및 정책 분석을 위한 검증된 기준점으로 카드를 활용할 수 있다.
Humanity’s Last Exam에서의 성능은 평가 프로토콜과 추론 컴퓨팅에 따라 달라진다. 각 곡선은 주어진 토큰 수 내에서 시도된 작업 중 해결된 누적 비율을 보여주며, 각 작업에서 처음으로 관측된 성공을 기준으로 한다.
커뮤니티가 기여할 수 있는 방법
EvalEval 코али션은 생태계 확장을 위해 세 그룹을 초대한다:
- 모델 개발자 – Get Verified 워크플로를 통해 자신의 모델에 대한 검증된 평가 카드를 제출.
- 벤치마크 개발자 – 오픈소스 EEE 스키마를 사용하여 새로운 벤치마크와 실험 데이터를 인코딩(제공된 GitHub 링크 참조).
- 평가, 거버넌스, 정책 분야의 연구자 – 공개 카드 레포지토리를 탐색하여 보고 품질을 평가하고 메타분석을 수행하거나 규제 프레임워크를 형성하는 데 기여.
EvalEval 코알리션 소개
EvalEval 코알리션은 AI 평가를 위한 강력하고 과학적으로 기반을 둔 인프라를 구축하는 데 초점을 맞춘 연구 커뮤니티이다. 주요 프로젝트는 다음과 같다:
- Every Eval Ever – 평가 결과를 위한 유니버설 스키마와 공개 레포지토리.
- 평가 카드 – 벤치마크 메타데이터, 런타임 데이터, 모델 메타데이터를 통합하여 해석 가능하고 비교 가능한 기록을 제공하는 인터페이스.
이 도구들은 동일한 점수가 물리적으로 다른 실험 조건에서 발생했을 때를 탐지할 수 있게 하여, 평가 기반 의사결정의 신뢰도를 높인다.
UK AI 보안 연구소(AISI) 소개
AISI는 과학, 혁신 및 기술부에 속한 UK 정부 연구 기관이다. 그들의 미션은 정부가 고급 AI의 위험에 대해 과학적 통찰을 얻을 수 있도록 돕는 것이다. AISI의 업무에는 다음이 포함된다:
- OptStop – 유망하지 않은 실험을 조기에 중단함으로써 평가 비용을 줄이는 방법.
- HiBayES – 계층적 베이지안 모델링을 통해 통계적으로 엄격한 LLM 평가를 수행.
- 벤치마크 간 전사 분석 및 능력 추출의 표준화.
추가 읽기
- How Inference Compute Shapes Frontier LLM Evaluation (arXiv:2606.17930)
- HiBayES: 계층적 베이지안 모델링을 통한 LLM 평가 개선 (AISI 블로그 및 arXiv:2505.05602)
- OptStop 논문 (arXiv:2608.14425)
- Every Eval Ever 프로젝트 페이지
- 평가 카드 포털