centerforaisafety/hle
Humanity's Last Exam
解决的问题
它解决了需要一个高难度、封闭式学术基准来测试AI模型在广泛学科领域知识极限的需求。该基准旨在成为此类基准的最终形态,推动人类知识的前沿,防止模型简单地记忆现有测试集。
如何工作
该项目提供了一个包含2,500个多模态问题的数据集,覆盖数十个学科,包括数学、人文学科和自然科学。这些问题为选择题或简答题,支持自动评分。项目包含一个使用 openai-python 接口的简单评估流水线,用于生成预测并判断结果。
适用对象
需要评估与人类学科专家同等水平的高级学术知识的AI研究人员和模型构建者。
特色亮点
- 覆盖数十个学科的多模态基准。
- 2,500个专家开发的问题。
- 包含一个canary字符串,帮助模型构建者从训练数据中过滤该数据集,防止数据污染。
- 支持选择题和简答题的自动评分。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目