OpenAI 감사 결과 SWE-bench Pro 작업의 30%가 손상되었습니다

OpenAI는 상세한 감사 결과 약 30%의 작업이 손상되었다는 사실을 확인한 후 SWE-bench Pro 코딩 벤치마크에 대한 권고를 철회했습니다. 분석 결과 데이터셋의 상당 부분이 논리적으로 결함이 있거나, 명세가 부족하거나, 과도하게 제한적인 테스트에 의해 평가되어 모델 능력을 의미 있게 측정하지 못한다는 것이 밝혀졌습니다.

감사 결과: 작업의 30%가 손상되었습니다

SWE-bench Pro의 731개 작업으로 구성된 공개 분할에 대한 감사에서 다수의 작업이 근본적으로 결함이 있음을 확인했습니다. 자동화된 데이터 포인트 분석 파이프라인은 200개의 작업(27.4%)을 문제점이 있는 것으로 표시했으며, 이후 경험 많은 소프트웨어 엔지니어들이 수행한 인간 주석 캠페인에서는 249개의 손상된 작업(34.1%)을 식별했습니다.

OpenAI는 실패 유형을 네 가지 주요 유형으로 분류했습니다:

  • 과도하게 엄격한 테스트: 프롬프트에 요청되지 않은 특정 구현 세부 사항을 강제하는 테스트로, 기능적으로 올바른 솔루션도 실패로 처리됩니다.
  • 명세가 부족한 프롬프트: 숨겨진 테스트에서 강제하지만 모델이 합리적으로 추론할 수 없는 요구사항을 누락한 프롬프트.
  • 낮은 커버리지 테스트: 요청된 기능을 충분히 검증하지 못해 불완전하거나 잘못된 수정이 통과될 수 있는 테스트.
  • 오해를 일으키는 프롬프트: 모델을 잘못된 동작으로 유도하거나 테스트 요구사항과 직접적으로 모순되는 지시문.

방법론: 하이브리드 에이전트-인간 검토

작업 실패가 실제 모델 한계에 기인한 것이지 벤치마크 자체의 결함이 아님을 확인하기 위해 OpenAI는 두 단계의 품질 보증 파이프라인을 적용했습니다.

자동화된 에이전트 필터링

초기 필터는 모델 시도, 작업 메타데이터, 실패 트레이스를 검토하여 잠재적으로 손상된 사례를 표시했습니다. 이 필터는 286개의 잠재적 문제 작업을 식별했습니다.

인간 감독 에이전트 감사

표시된 작업은 Codex 기반 조사 에이전트를 사용해 감사되었습니다. 이 에이전트는 작업 저장소와 환경에 접근할 수 있어 테스트를 실행하고 파일을 검사함으로써 합리적인 모호성과 진정한 명세 부족을 구분할 수 있었습니다. 이후 연구자가 에이전트의 요약을 검토하여 최종 판단을 내렸습니다.

인간 주석 캠페인

동시에, 다섯 명의 경험 많은 소프트웨어 엔지니어가 각 표시된 작업을 독립적으로 검토했습니다. 검토자는 문제 설명, 테스트 케이스, 그리고 “gold patch”(정답 참조 솔루션)를 분석한 뒤 라벨과 심각도 등급을 부여했습니다.

OpenAI는 인간 검토자가 조사 에이전트보다 작업을 손상된 것으로 표시할 가능성이 높았으며, 작업당 여러 겹치는 문제를 식별할 가능성도 더 높았다고 언급했습니다. 구체적으로, 인간은 벤치마크의 9.4%에서 낮은 커버리지 테스트를 가장 흔한 문제로 식별했으며, 이는 에이전트 파이프라인이 식별한 4.1%와 비교됩니다.

벤치마크에서 실제 데이터의 도전 과제

OpenAI는 이러한 결함이 SWE-bench 작업이 수집되는 방식에 기인한다고 설명합니다. 작업은 공개 및 비공개 저장소의 기능 변경 이력을 프로그램matically 추출한 것이기 때문에 인간 협업의 복잡하고 지저분한 현실을 반영하는 경우가 많습니다.

오픈소스 저장소의 풀 리퀘스트와 이슈는 유지관리자와 기여자 간의 긴 논의를 거쳐 생성되는 경우가 흔합니다. 따라서 병합된 코드와 단위 테스트가 완전히 일치하지 않아 깔끔하고 독립적인 작업을 형성하지 못할 수 있습니다. 풀 리퀘스트에 포함된 테스트는 문제 해결을 위한 구현-중립적인 표준을 정의하기보다 특정 변경을 검증하기 위해 작성되는 경우가 많습니다.

커뮤니티 관점 및 반론

산업 실무자와 연구자들은 이러한 결과의 타당성과 벤치마크의 유용성에 대해 여러 의견을 제시했습니다:

"근본적으로는 소프트웨어 개발자(인간이든 아니든)에게 할당된 작업이 종종 불완전하고, 스스로 모순되거나 더 나쁜 상황이라는 결론을 내리는 것이 아닐까요? 이것이 그들의 도구가 작동해야 하는 세계입니다."

일부는 명세가 부족한 프롬프트와 모순된 지시가 소프트웨어 엔지니어의 핵심 업무이며, 따라서 이러한 “결함”은 모델이 실제 세계의 모호성을 처리할 수 있는지를 테스트하는 현실적인 평가라고 주장합니다. 다른 이들은 현재 많은 벤치마크가 “원샷” 형태이며 실제 소프트웨어 개발을 특징짓는 장기 반복 사이클을 테스트하지 못한다고 지적합니다.

또한 “benchmaxxing”—리더보드인 Terminal Bench 2.0 등에서 실험실이 타임아웃이나 하드웨어 구성을 인위적으로 조정해 결과를 부풀리는 관행—에 대한 우려도 제기되었습니다. 이는 공개 코딩 평가에서 신호 대 잡음 비율을 더욱 악화시킬 수 있습니다.

결론

OpenAI는 평가가 유용하려면 조작하기 어렵고, 신뢰하기 쉬우며, 모델 능력을 진정으로 반영해야 한다고 결론짓습니다. SWE-bench Pro의 높은 오류율을 고려할 때, OpenAI는 모델 개발자들에게 결과를 신중히 검토할 것을 권고하고, 커뮤니티가 경험 많은 개발자가 직접 설계한, 프로그램matically 수집된 데이터가 아닌 벤치마크로 전환할 것을 제안합니다.

SUMMARY: OpenAI는 SWE-bench Pro에 대한 권고를 철회했으며, 감사 결과 벤치마크 작업의 약 30%가 과도하게 엄격한 테스트, 명세가 부족한 프롬프트, 혹은 낮은 테스트 커버리지 때문에 손상된 것으로 밝혀졌습니다.

TITLE: OpenAI 감사 결과 SWE-bench Pro 작업의 30%가 손상되었습니다

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch