OpenAI MLE-bench: 머신러닝 엔지니어링에서 머신러닝 에이전트 평가
OpenAI는 머신러닝(ML) 엔지니어링에서 AI 에이전트의 성능을 측정하도록 설계된 벤치마크인 MLE-bench를 도입했습니다. 75개의 선별된 Kaggle 대회를 활용하여, 이 벤치마크는 에이전트가 모델을 학습하고, 데이터셋을 준비하며, 실제 ML 엔지니어링 시나리오에서 실험을 수행하는 능력을 테스트합니다.
벤치마크 설계 및 방법론
MLE-bench는 복잡한 ML 엔지니어링 작업을 해결하는 AI 에이전트의 능력을 평가합니다. 이 벤치마크는 Kaggle에서 가져온 75개의 ML 엔지니어링 관련 대회로 구성됩니다. 이러한 작업은 다음과 같은 다양한 실제 기술을 테스트하도록 설계되었습니다:
모델 학습: 머신러닝 모델을 구현하고 학습시키는 능력.
데이터셋 준비: 모델 학습을 위해 데이터를 처리하고 준비하는 능력.
실험: 모델 성능을 반복적으로 향상시키기 위해 실험을 실행하고 관리하는 능력.
인간 성능의 기준선을 설정하기 위해, OpenAI는 Kaggle의 공개 리더보드를 사용합니다.
성능 결과
OpenAI는 오픈소스 에이전트 스캐폴드를 사용하여 여러 최첨단 언어 모델을 평가했습니다. 가장 높은 성능을 보인 구성—OpenAI의 o1-preview 모델과 AIDE 스캐폴딩을 결합한 구성—은 대회 중 16.9%에서 Kaggle 브론즈 메달 수준의 성능에 도달했습니다.
연구 초점 및 자원 스케일링
MLE-bench와 함께 제공되는 연구는 주요 성능 지표를 넘어 에이전트 성능에 영향을 미치는 여러 중요한 요소를 탐구합니다:
자원 스케일링: AI 에이전트에 대한 다양한 형태의 자원 스케일링을 조사하여 추가 자원이 성공률에 어떤 영향을 미치는지 파악합니다.
사전 학습 오염: 모델의 사전 학습 데이터에서 발생하는 오염이 결과에 어떤 영향을 미칠 수 있는지 조사합니다.
가용성
AI 에이전트의 ML 엔지니어링 역량에 대한 추가 연구를 촉진하기 위해, OpenAI는 GitHub에 벤치마크 코드를 오픈소스로 공개했습니다.