SWE-Bench Pro 코딩 평가 결함에 대한 OpenAI 분석

SWE-Bench Pro 코딩 평가 결함에 대한 OpenAI 분석

OpenAI는 SWE-Bench Pro 코딩 벤치마크에 중대한 결함이 있음을 확인했으며, 전체 작업의 약 30%가 손상된 것으로 추정합니다. 이러한 결과로 OpenAI는 모델 개발자들이 SWE-Bench Pro를 SWE-bench Verified의 대체로 채택하라는 이전 권고를 철회했습니다.

감사 결과 및 작업 실패율

SWE-Bench Pro 공개 분할(731개 작업)에 대한 감사를 통해 데이터셋의 상당 부분이 모델 능력에 대한 신뢰할 수 없는 신호를 제공한다는 것이 밝혀졌습니다. 분석에서는 사용된 방법론에 따라 두 가지 다른 실패율을 확인했습니다:

  • Human Annotation: 249개의 손상된 작업을 식별함 (34.1%).
  • Data Quality Pipeline: 200개의 손상된 작업을 표시함 (27.4%).

평가 결함의 주요 범주

OpenAI는 손상된 작업을 벤치마크 결과를 무효화하는 네 가지 주요 실패 모드로 분류했습니다:

  • Overly Strict Tests: 프롬프트에서 요청되지 않은 특정 구현 세부 사항을 강제하는 테스트로, 기능적으로 올바른 솔루션이 잘못된 것으로 표시됩니다.
  • Underspecified Prompts: 숨겨진 테스트에 의해 강제되지만 모델이 합리적으로 추론할 수 없는 요구 사항을 누락한 프롬프트.
  • Low-Coverage Tests: 요청된 기능을 충분히 검사하지 않는 테스트로, 불완전하거나 잘못된 수정이 통과될 수 있습니다.
  • Misleading Prompts: 모델을 잘못된 행동으로 유도하거나 테스트 요구 사항과 직접적으로 모순되는 프롬프트.

품질 보증 방법론

작업 실패가 벤치마크 결함이 아니라 실제 모델 제한을 반영하도록 하기 위해 OpenAI는 다단계 품질 보증 파이프라인을 사용했습니다:

자동 필터링

초기 자동 필터가 모델 시도, 작업 메타데이터 및 실패 추적을 검토하여 잠재적으로 문제 있는 286개의 작업을 표시했습니다.

인간 감독 에이전트 검토

Codex 기반 조사 에이전트에게 작업 저장소와 환경에 대한 접근 권한이 부여되었습니다. 이 에이전트들은 테스트를 실행하고 파일을 검사하며 일반적인 실패 모드를 조사하여 합리적인 모호성과 실제 미지정 사이를 구분했습니다. 이후 연구자가 에이전트 요약을 검토하여 최종 판단을 내렸습니다.

인간 주석 캠페인

경험 많은 소프트웨어 엔지니어들이 표시된 하위 집합을 검토했습니다. 각 작업은 문제 설명, 테스트 케이스 및 골드 패치(정답 기준 솔루션)를 기반으로 독립적인 판단을 내린 5명의 엔지니어가 검토했으며, 이후 파이프라인 분석을 검토했습니다.

에이전트와 인간 검토 비교

인간 검토자는 조사 에이전트보다 작업을 손상된 것으로 식별할 가능성이 높았습니다. 에이전트 파이프라인과 인간 검토자가 74%의 경우에서 겹쳤지만, 인간은 단일 작업에 여러 라벨을 부여할 가능성이 더 높아 에이전트+검토자 파이프라인이 보수적임을 시사합니다. 가장 눈에 띄는 차이는 “low-coverage tests”에서 나타났으며, 인간은 벤치마크의 9.4%를 식별한 반면 에이전트 파이프라인은 4.1%만 식별했습니다.

코딩 벤치마크에 대한 시사점

OpenAI는 이슈와 풀 리퀘스트가 인간 협업을 위해 설계된 오픈소스 저장소 기록에서 프로그래밍 방식으로 추출된 벤치마크가 종종 깨끗하고 독립적인 작업을 생성하지 못한다고 지적합니다. 풀 리퀘스트의 테스트는 구현에 구애받지 않는 표준을 정의하기보다 특정 변경을 검증하기 위해 작성되는 경우가 많습니다.

OpenAI는 모델 평가를 위해 경험 많은 소프트웨어 개발자가 직접 만든 새로운 벤치마크 개발을 옹호합니다. 이는 벤치마크가 조작하기 어렵고 신뢰하기 쉬우며 모델 능력을 진정으로 반영하도록 하기 위함입니다.


SUMMARY: OpenAI는 감사 결과 벤치마크 작업의 약 30%가 과도하게 엄격한 테스트와 미지정된 프롬프트와 같은 문제로 손상된 것으로 밝혀진 후 SWE-Bench Pro에 대한 권고를 철회했습니다.

TITLE: SWE-Bench Pro 코딩 평가 결함에 대한 OpenAI 분석

Sources