centerforaisafety/hle
Humanity's Last Exam
解決的問題
解決了需要一個高難度、封閉式學術基準,以測試AI模型在廣泛學科領域知識極限的需求。此基準旨在成為此類基準的最終形態,推動人類知識的前沿,防止模型僅僅記憶現有測試集。
如何運作
本專案提供一個包含2,500個多模態問題的資料集,涵蓋數十個學科,包括數學、人文學科和自然科學。這些問題為選擇題或簡答題,支援自動評分。專案包含一個使用 openai-python 接口的簡單評估流程,用於產生預測並判斷結果。
適用對象
需要評估與人類學科專家同等水準的高階學術知識的AI研究人員與模型建構者。
特色亮點
- 覆蓋數十個學科的多模態基準。
- 2,500個專家開發的問題。
- 包含一個canary字串,幫助模型建構者從訓練資料中過濾該資料集,防止資料污染。
- 支援選擇題與簡答題的自動評分。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案