centerforaisafety/hle

Humanity's Last Exam

解决的问题

它解决了需要一个高难度、封闭式学术基准来测试AI模型在广泛学科领域知识极限的需求。该基准旨在成为此类基准的最终形态,推动人类知识的前沿,防止模型简单地记忆现有测试集。

如何工作

该项目提供了一个包含2,500个多模态问题的数据集,覆盖数十个学科,包括数学、人文学科和自然科学。这些问题为选择题或简答题,支持自动评分。项目包含一个使用 openai-python 接口的简单评估流水线,用于生成预测并判断结果。

适用对象

需要评估与人类学科专家同等水平的高级学术知识的AI研究人员和模型构建者。

特色亮点

  • 覆盖数十个学科的多模态基准。
  • 2,500个专家开发的问题。
  • 包含一个canary字符串,帮助模型构建者从训练数据中过滤该数据集,防止数据污染。
  • 支持选择题和简答题的自动评分。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目