OpenAI MLE-bench: 機械学習エンジニアリングにおける機械学習エージェントの評価
OpenAIはMLE-benchを導入しました。このベンチマークは機械学習(ML)エンジニアリングにおけるAIエージェントの性能を測定するよう設計されています。75の厳選されたKaggleコンペティションを活用することで、ベンチマークはエージェントがモデルを訓練し、データセットを準備し、実際のMLエンジニアリングシナリオで実験を実行する能力をテストします。
ベンチマークの設計と方法論
MLE-benchは、複雑なMLエンジニアリングタスクを解決する能力に基づいてAIエージェントを評価します。このベンチマークはKaggleから取得した75のMLエンジニアリング関連コンペティションで構成されています。これらのタスクは、以下を含む多様な実務スキルをテストするよう設計されています。
モデル訓練: 機械学習モデルを実装し訓練する能力。
データセット準備: モデル訓練のためにデータを処理し準備する能力。
実験: 実験を実行・管理し、モデル性能を反復的に向上させる。
人間のパフォーマンスのベースラインを確立するため、OpenAIはKaggleの公開リーダーボードを使用します。
パフォーマンス結果
OpenAIは、オープンソースのエージェントスキャフォールドを使用して、いくつかの最先端言語モデルを評価しました。最高性能の構成—OpenAIのo1-previewモデルとAIDEスキャフォールドの組み合わせ—は、コンペティションの16.9%でKaggleのブロンズメダルレベルの性能に到達しました。
研究の焦点とリソーススケーリング
主要なパフォーマンス指標を超えて、MLE-benchに付随する研究は、エージェントの性能に影響を与えるいくつかの重要な要因を探ります:
リソーススケーリング: AIエージェントのさまざまな形態のリソーススケーリングを調査し、追加リソースが成功率にどのように影響するかを判断します。
事前学習汚染: モデルの事前学習データからの汚染の影響を調査し、結果に影響を与える可能性があります。
利用可能性
AIエージェントのMLエンジニアリング能力に関するさらなる研究を促進するため、OpenAIはベンチマークコードをGitHubでオープンソース化しました。