centerforaisafety/hle

Humanity's Last Exam

해결하는 문제

AI 모델의 지식 한계를 평가하기 위한 고난도이고 폐쇄형의 학문적 벤치마크가 필요하다는 문제를 해결합니다. 기존 테스트 세트를 단순히 암기하는 것을 방지하고, 인간 지식의 최전선을 시험할 수 있도록 설계된 최후의 벤치마크입니다.

작동 방식

수학, 인문학, 자연과학 등 수십 가지 분야를 아우르는 2,500개의 멀티모달 질문 데이터셋을 제공합니다. 질문은 다지선다형 또는 단답형이며, 자동 채점이 가능합니다. openai-python 인터페이스를 사용한 간단한 평가 파이프라인을 통해 예측을 생성하고 결과를 평가할 수 있습니다.

대상 사용자

인간의 전문가 수준의 고도의 학문 지식을 평가해야 하는 AI 연구자 및 모델 개발자.

주요 특징

  • 수십 가지 분야를 아우르는 멀티모달 벤치마크.
  • 전문가가 개발한 2,500개의 질문.
  • 모델 개발자가 학습 데이터에서 데이터셋을 필터링하여 데이터 오염을 방지할 수 있도록 카니어 스트링 포함.
  • 다지선다형 및 단답형 응답에 대한 자동 채점.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트