Real-SWE 벤치마크: 사내 기업 코드베이스에서 AI 코딩 에이전트 평가

Real-SWE 벤치마크는 최첨단 AI 코딩 에이전트가 사내 실무 기업 코드베이스의 복잡성에 크게 어려움을 겪고 있음을 드러냅니다. 합성 벤치마크에서는 높은 성공률을 보이지만, Real-SWE는 공개 인터넷에 존재하지 않는 프라이버시 코드베이스와 기업 로직이 인프라와 깊이 얽혀 있는 전용 시스템으로의 전환 시, 모든 테스트 모델의 해결률이 40% 미만으로 떨어진다는 점을 보여줍니다.

모델 성능 및 랭킹

Fable 5.1이 38.8%의 해결률로 벤치마크를 선도하며, GPT-6 Astra와 Gemini 3.8 Flash가 뒤를 이어 있습니다. 결과는 프로페셔널 소프트웨어 엔지니어가 생산 환경에서 요구하는 기술과 AI의 능력 사이에 상당한 격차가 있음을 시사합니다.

순위 모델 해서스 해결률
1 Fable 5.1 Claude Code 38.8%
2 GPT-6 Astra Codex CLI 33.8%
3 Gemini 3.8 Flash Gemini CLI 31.2%
4 GLM 5.3 Claude Code 28.8%
5 Grok 4.6 Grok Build 23.8%
5 Muse Spark 1.3 Muse Code 23.8%
7 Kimi K3 Kimi Code 18.8%
8 GPT-5.6 Sol Codex CLI 16.2%

해결률은 각 작업당 8회 독립 실행된 pass@1 평균값으로 계산됩니다.

기업 코드베이스가 더 도전적인 이유

Real-SWE 작업은 실제 기업의 라이선스된 사내 코드베이스를 활용하기 때문에 AI 모델에게 "분포 외"(out of distribution) 상태가 되도록 설계되었습니다. 이는 모델이 공개 인터넷에서 찾을 수 있는 학습 데이터에 의존하는 것을 방지합니다.

기업 고유의 복잡성

기업 엔지니어링은 문법 지식 이상을 요구합니다. 내부 코딩 패턴과 기업 규칙을 이해하는 것이 필요합니다. 예를 들어, 한 작업은 인보이스 청구를 수정하는 것으로, 에이전트는 NestJS/TypeScript 서비스를 탐색하고 TaxJar 및 InfluxDB와 같은 외부 서비스와 상호작용하여 특정 기업 설정에 따라 세금 면제 및 부가세 등록을 처리해야 합니다.

다기능 구현

현실 세계의 변경은 단일 파일 내에 국한되지 않습니다. Real-SWE 참조 솔루션에서 편집된 파일의 중앙값은 11개이며, FrontierCode 및 DeepSWE와 같은 다른 벤치마크의 중앙값인 6개보다 높습니다. 이는 에이전트가 AWS, Kubernetes, PostgreSQL, Redis와 같은 여러 서비스 및 인프라 구성 요소를 통해 시스템에 대한 정신적 지도를 유지해야 함을 의미합니다.

모델 실패 분석

실패 분석 결과, 실패의 가장 흔한 원인은 "요구사항 누락"이며, 그 다음은 "검증되지 않은 가정"입니다. 이는 모델이 코드를 작성할 수는 있지만, 비즈니스 의도를 완전히 이해하거나 기존 시스템과의 변경 사항을 검증하는 데 어려움을 겪고 있음을 시사합니다.

작업별 변동성

성능은 작업에 따라 극심하게 달라집니다. "다중 영역 스위프" 작업은 67.2%의 해결률을 기록하지만, "분석 스트림 리듀서" 작업은 모든 테스트 모델에서 0.0%의 해결률을 기록합니다. 이는 특정 유형의 복잡한 비즈니스 로직이나 아키텍처 패턴이 현재 최첨단 모델에게는 완전히 해결 불가능하다는 점을 시사합니다.

배포 기간 및 비용

작업에 소요된 시간과 성공률 사이에 거의 상관관계가 없습니다. 10분 미만의 배포 중 71.4%가 실패했으며, 장시간 배포 중 73.4%가 실패했습니다. 배포당 추정 비용은 Gemini 3.8 Flash의 $2.50에서 Fable 5.1의 $6.96까지 다양합니다.

커뮤니티의 통찰과 반론

Hacker News에서 엔지니어들 간의 논의는 벤치마크 결과와 개인 사용자 경험 사이의 갈등을 드러냅니다.

도구와 맥락

일부 사용자는 에이전트의 성공 여부가 해서스와 모델에 제공되는 "맥락 지도"에 더 크게 의존한다고 주장합니다. 한 사용자는 "코드 아틀라스"—코드베이스 연결을 의미적으로 쿼리 가능한 지도—를 구축하면 모델이 코드를 읽는 데 소요하는 시간을 크게 줄이고 세부 사항에 대한 인식을 향상시킬 수 있다고 제안했습니다.

방법론에 대한 우려

벤치마크에 대한 비판자들은 코드베이스가 사내이기 때문에 재현 불가능하며, "핑키-프라미스 벤치마크"의 가능성에 주목했습니다.

"TL;DR 완전히 재현 불가능한 방식으로 벤치마크를 하는 것인가요? '모델 X는 훌륭하게 작동했지만, 그 코드가 어떤 회사의 큰 코드베이스였는지 외에는 아무것도 알려줄 수 없습니다.'"

또한 일부 사용자는 사내 코드베이스가 진정으로 사내인지, 아니면 최첨단 모델의 학습 데이터셋에 유출되었는지에 대해 의문을 제기하며, 현대 LLM 평가에서 오염이 지속적인 위험임을 지적했습니다.

실용적 관찰

몇몇 사용자는 Gemini 3.8 Flash가 이 벤치마크에서 높은 성능을 보인 것이 자신의 경험과 일치한다고 지적하며, 명확하게 정의된 기업 환경에서 문제를 해결하는 데 "숨겨진 보석"처럼 작용한다고 설명했습니다. 비록 개방형 질문에서는 어려움을 겪지만 말이죠.

Sources

관련