OpenAI MLE-bench:評估機器學習工程中的機器學習代理

OpenAI 已推出 MLE-bench,這是一個旨在衡量 AI 代理在機器學習(ML)工程中表現的基準測試。透過使用 75 場精選的 Kaggle 競賽,該基準測試評估代理在真實 ML 工程情境下訓練模型、準備資料集以及執行實驗的能力。

基準設計與方法論

MLE-bench 評估 AI 代理解決複雜 ML 工程任務的能力。該基準測試由 75 場來自 Kaggle 的 ML 工程相關競賽組成。這些任務旨在測試多樣的真實世界技能,包括:

  • 模型訓練: 實作與訓練機器學習模型的能力。

  • 資料集準備: 處理與準備模型訓練資料的能力。

  • 實驗: 執行與管理實驗,以迭代提升模型效能。

為了建立人類表現的基準,OpenAI 使用 Kaggle 公開的排行榜。

效能結果

OpenAI 使用開源代理框架評估了多個前沿語言模型。表現最佳的配置——OpenAI 的 o1-preview 模型結合 AIDE 框架——在 16.9% 的競賽中達到 Kaggle 銅牌的表現水平。

研究重點與資源擴展

除了主要的效能指標外,伴隨 MLE-bench 的研究還探討了影響代理效能的多項關鍵因素:

  • 資源擴展: 探討 AI 代理各種資源擴展形式,以確定額外資源如何影響其成功率。

  • 預訓練污染: 探討模型預訓練資料的污染對結果可能產生的影響。

可用性

為了促進對 AI 代理機器學習工程能力的進一步研究,OpenAI 已在 GitHub 上開源了基準測試程式碼。

Sources