centerforaisafety/hle

Humanity's Last Exam

解決的問題

解決了需要一個高難度、封閉式學術基準,以測試AI模型在廣泛學科領域知識極限的需求。此基準旨在成為此類基準的最終形態,推動人類知識的前沿,防止模型僅僅記憶現有測試集。

如何運作

本專案提供一個包含2,500個多模態問題的資料集,涵蓋數十個學科,包括數學、人文學科和自然科學。這些問題為選擇題或簡答題,支援自動評分。專案包含一個使用 openai-python 接口的簡單評估流程,用於產生預測並判斷結果。

適用對象

需要評估與人類學科專家同等水準的高階學術知識的AI研究人員與模型建構者。

特色亮點

  • 覆蓋數十個學科的多模態基準。
  • 2,500個專家開發的問題。
  • 包含一個canary字串,幫助模型建構者從訓練資料中過濾該資料集,防止資料污染。
  • 支援選擇題與簡答題的自動評分。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案