OpenAI, SWE-bench Verified 평가 중단
OpenAI는 SWE-bench Verified 벤치마크에 대한 결과 보고를 중단했으며, 이는 이제 최첨단 AI 모델의 실제 소프트웨어 엔지니어링 역량을 정확히 측정하지 못한다는 결론에 이르렀기 때문입니다. 이 결정은 점수 향상이 실제 능력 향상이 아니라 훈련 데이터 오염을 반영하는 경우가 많으며, 벤치마크의 테스트 케이스에 심각한 결함이 존재한다는 분석 결과에 따른 것입니다.
결함이 있는 테스트 케이스 설계
OpenAI가 일관되게 해결하지 못한 138개의 문제를 감사한 결과, 이 중 59.4%가 테스트 설계나 문제 설명에 근본적인 문제가 있음을 발견했습니다. 이러한 결함은 모델의 역량과 무관하게 작업을 거의 불가능하게 만듭니다.
OpenAI는 이러한 실패를 두 가지 주요 유형으로 분류했습니다:
- Narrow Test Cases (35.5%): 문제 설명에 요구되지 않은 특정 구현 세부 사항을 강제하는 테스트입니다. 예를 들어,
pylint-dev__pylint-4551작업에서는 모델이 새로운 함수get_annotation의 이름을 지정하지 않아 테스트가 실패했지만, 요구 사항에 함수 이름이 명시되지 않았습니다. - Wide Test Cases (18.8%): 문제 설명에 언급되지 않은 기능을 검사하는 테스트입니다.
sympy__sympy-18199작업에서는 원래 PR에서 다룬 세 가지 이슈 중 하나만 설명에 포함되었지만, 테스트는 세 가지 모두에 대한 수정이 필요했습니다.
훈련 데이터 오염
SWE-bench 문제는 모델 훈련에 사용되는 오픈소스 저장소에서 가져오기 때문에, 최첨단 모델들은 훈련 단계에서 솔루션(골드 패치)에 노출되었습니다. OpenAI는 테스트된 모든 최첨단 모델이 특정 작업에 대해 원본 인간 작성 버그 수정이나 문제 세부 사항을 그대로 재현할 수 있음을 발견했습니다.
오염 증거는 여러 모델군에 걸쳐 발견되었습니다:
- GPT-5.2: 문제 진술에 명시되지 않은 릴리즈 노트와 특정 파라미터(예: Django 4.1의
edit_only)에 대한 지식을 보여주었습니다. - Claude Opus 4.5: 원본 diff에서 네 줄짜리 기능 변경, 특정 파일명, 정확한 인라인 주석을 그대로 기억했습니다.
- Gemini 3 Flash: 작업 ID만을 프롬프트로 사용해 작업 설명과 골드 패치의 정확한 정규식 식, 라인 번호 등을 그대로 출력했습니다.
OpenAI는 훈련 중 이러한 문제에 노출된 모델이 언더스펙된 혹은 결함이 있는 테스트를 통과하는 데 필요한 추가 정보를 보유하고 있기 때문에 성공 가능성이 더 높다고 언급했습니다.
AI 평가에 대한 시사점
OpenAI는 향후 AI 벤치마크 설계에 대해 두 가지 중요한 교훈을 제시합니다:
- Contamination Risk: 공개 자료에서 추출한 벤치마크는 점수 부풀림이 조용히 발생하기 쉽습니다. OpenAI는 개발자들이 비밀번호 보호 데이터셋과 엄격한 카나리 문자열을 사용해 훈련 데이터 필터링을 수행할 것을 권고합니다.
- Automated Scoring Complexity: 중요하지 않은 구현 세부 사항에 무관하면서도 우회 방법에 강인한 완벽한 테스트 케이스를 만드는 일은 본질적으로 어렵고, 광범위한 인간 검토가 필요합니다.
권장 대안
OpenAI는 현재 코딩 역량을 추적하기 위한 새로운, 오염되지 않은 평가를 개발 중이며, 그 사이에 연구소는 모델 개발자들이 SWE-bench Pro의 공개 분할 결과를 보고하도록 권장합니다. 완벽하지는 않지만, 실증적 증거에 따르면 SWE-bench Pro는 오염이 현저히 적으며, 어떤 테스트된 모델도 완전한 골드 패치를 그대로 생성하지 못했습니다.
고위험 측정을 위해 OpenAI는 GDPVal을 제시합니다. 여기서는 작업이 도메인 전문가에 의해 비공개로 작성되고, 인간 리뷰어가 전체적으로 평가하여 노출 위험을 제거합니다.
SUMMARY: OpenAI는 결함이 있는 테스트 케이스와 훈련 데이터 오염으로 인해 벤치마크가 최첨단 모델의 코딩 역량을 신뢰할 수 없는 측정 수단이 되었다는 이유로 SWE-bench Verified 점수 보고를 중단했습니다.
TITLE: OpenAI, SWE-bench Verified 평가 중단