OpenAI MLE-bench:評估機器學習工程中的機器學習代理
OpenAI 已推出 MLE-bench,這是一個旨在衡量 AI 代理在機器學習(ML)工程中表現的基準測試。透過使用 75 場精選的 Kaggle 競賽,該基準測試評估代理在真實 ML 工程情境下訓練模型、準備資料集以及執行實驗的能力。
基準設計與方法論
MLE-bench 評估 AI 代理解決複雜 ML 工程任務的能力。該基準測試由 75 場來自 Kaggle 的 ML 工程相關競賽組成。這些任務旨在測試多樣的真實世界技能,包括:
模型訓練: 實作與訓練機器學習模型的能力。
資料集準備: 處理與準備模型訓練資料的能力。
實驗: 執行與管理實驗,以迭代提升模型效能。
為了建立人類表現的基準,OpenAI 使用 Kaggle 公開的排行榜。
效能結果
OpenAI 使用開源代理框架評估了多個前沿語言模型。表現最佳的配置——OpenAI 的 o1-preview 模型結合 AIDE 框架——在 16.9% 的競賽中達到 Kaggle 銅牌的表現水平。
研究重點與資源擴展
除了主要的效能指標外,伴隨 MLE-bench 的研究還探討了影響代理效能的多項關鍵因素:
資源擴展: 探討 AI 代理各種資源擴展形式,以確定額外資源如何影響其成功率。
預訓練污染: 探討模型預訓練資料的污染對結果可能產生的影響。
可用性
為了促進對 AI 代理機器學習工程能力的進一步研究,OpenAI 已在 GitHub 上開源了基準測試程式碼。