OpenAI SWE-Lancer 벤치마크 출시
OpenAI는 Upwork에서 sourced된 1,400개 이상의 프리랜서 소프트웨어 엔지니어링 작업으로 구성된 SWE-Lancer를 출시했습니다. 이 벤치마크는 연구자들이 실제 유료 소프트웨어 엔지니어링 문제를 해결하는 AI 모델의 능력을 평가할 수 있게 하며, 모델 성능을 직접 금전적 가치에 매핑하여 AI 개발의 경제적 영향을 평가할 수 있습니다.
SWE-Lancer의 기술적 구성
SWE-Lancer는 실제 전문 소프트웨어 엔지니어링 작업을 반영하는 다양한 작업 범위를 포함합니다. 이 벤치마크는 작업의 두 가지 주요 범주로 나뉩니다:
독립 엔지니어링 작업
이 작업들은 복잡성과 가치 면에서 다양하며, $50 가치의 작은 버그 수정부터 $32,000까지 가치 있는 대규모 기능 구현까지 포함됩니다. 이러한 작업은 정확성을 보장하기 위해 경험이 풍부한 소프트웨어 엔지니어가 삼중 검증한 엔드-투-엔드 테스트를 사용하여 채점됩니다.
관리 작업
기술적 구현을 넘어, SWE-Lancer는 모델이 서로 다른 기술 구현 제안 중에서 선택해야 하는 관리 작업을 포함합니다. 이러한 결정은 원래 고용된 엔지니어링 관리자들이 내린 동일한 선택과 비교하여 평가됩니다.
모델 성능 및 평가
OpenAI는 현재 프론티어 모델이 SWE-Lancer 벤치마크 내 작업의 대부분을 해결할 수 없다고 보고합니다. 이는 현재 AI 능력과 프리랜서 작업에 필요한 전문 소프트웨어 엔지니어링 표준 사이에 상당한 격차가 있음을 나타냅니다.
연구 접근성 및 업데이트
연구 커뮤니티를 지원하기 위해 OpenAI는 통합 Docker 이미지와 SWE-Lancer Diamond라고 알려진 공개 평가 분할을 오픈소스로 공개했습니다.
2025년 7월 28일의 업데이트에 따르면, 데이터셋과 결과가 2025년 7월 17일에 업데이트되었습니다. 이 업데이트는 실행 중 인터넷 연결 요구 사항을 제거하여 모델 성능의 주요 변동성을 제거하려는 의도였습니다. 업데이트된 데이터셋과 결과는 OpenAI preparedness GitHub repository를 통해 이용할 수 있습니다.
경제적 영향 매핑
총 $1 million USD의 실제 지불금을 갖는 작업을 활용하여, SWE-Lancer는 AI 기반 소프트웨어 엔지니어링의 경제적 가치를 연구할 수 있도록 설계되었으며, 모델 성능 향상에 대한 금전적 지표를 제공합니다.