OpenAI MLE-bench:评估机器学习工程中的机器学习代理
OpenAI 推出了 MLE-bench,这是一项旨在衡量 AI 代理在机器学习(ML)工程中表现的基准。通过利用 75 场精选的 Kaggle 竞赛,该基准测试代理在真实的机器学习工程场景中训练模型、准备数据集和运行实验的能力。
基准设计与方法论
MLE-bench 评估 AI 代理解决复杂机器学习工程任务的能力。该基准由来自 Kaggle 的 75 场机器学习工程相关竞赛组成。这些任务旨在测试一系列真实世界技能,包括:
- 模型训练: 实现并训练机器学习模型的能力。
- 数据集准备: 处理并准备模型训练数据的能力。
- 实验: 运行和管理实验,以迭代提升模型性能。
为了建立人类表现的基准,OpenAI 使用了 Kaggle 公开的排行榜。
性能结果
OpenAI 使用开源代理框架评估了多个前沿语言模型。表现最佳的配置——OpenAI 的 o1-preview 模型结合 AIDE 框架——在 16.9% 的竞赛中达到了 Kaggle 铜牌水平的表现。
研究重点与资源扩展
除了主要的性能指标,MLE-bench 附带的研究还探讨了影响代理表现的若干关键因素:
- 资源扩展: 调查 AI 代理的各种资源扩展形式,以确定额外资源如何影响其成功率。
- 预训练污染: 调查模型预训练数据的污染对结果的影响。
可用性
为了促进对 AI 代理机器学习工程能力的进一步研究,OpenAI 已在 GitHub 上开源了基准代码。