OpenAI MLE-bench:评估机器学习工程中的机器学习代理

OpenAI 推出了 MLE-bench,这是一项旨在衡量 AI 代理在机器学习(ML)工程中表现的基准。通过利用 75 场精选的 Kaggle 竞赛,该基准测试代理在真实的机器学习工程场景中训练模型、准备数据集和运行实验的能力。

基准设计与方法论

MLE-bench 评估 AI 代理解决复杂机器学习工程任务的能力。该基准由来自 Kaggle 的 75 场机器学习工程相关竞赛组成。这些任务旨在测试一系列真实世界技能,包括:

  • 模型训练: 实现并训练机器学习模型的能力。
  • 数据集准备: 处理并准备模型训练数据的能力。
  • 实验: 运行和管理实验,以迭代提升模型性能。

为了建立人类表现的基准,OpenAI 使用了 Kaggle 公开的排行榜。

性能结果

OpenAI 使用开源代理框架评估了多个前沿语言模型。表现最佳的配置——OpenAI 的 o1-preview 模型结合 AIDE 框架——在 16.9% 的竞赛中达到了 Kaggle 铜牌水平的表现。

研究重点与资源扩展

除了主要的性能指标,MLE-bench 附带的研究还探讨了影响代理表现的若干关键因素:

  • 资源扩展: 调查 AI 代理的各种资源扩展形式,以确定额外资源如何影响其成功率。
  • 预训练污染: 调查模型预训练数据的污染对结果的影响。

可用性

为了促进对 AI 代理机器学习工程能力的进一步研究,OpenAI 已在 GitHub 上开源了基准代码。

Sources