Real-SWE 벤치마크: 사내 기업 코드베이스에서 AI 코딩 에이전트 평가
Real-SWE 벤치마크는 최첨단 AI 코딩 에이전트가 사내 실무 기업 코드베이스의 복잡성에 크게 어려움을 겪고 있음을 드러냅니다. 합성 벤치마크에서는 높은 성공률을 보이지만, Real-SWE는 공개 인터넷에 존재하지 않는 프라이버시 코드베이스와 기업 로직이 인프라와 깊이 얽혀 있는 전용 시스템으로의 전환 시, 모든 테스트 모델의 해결률이 40% 미만으로 떨어진다는 점을 보여줍니다.
모델 성능 및 랭킹
Fable 5.1이 38.8%의 해결률로 벤치마크를 선도하며, GPT-6 Astra와 Gemini 3.8 Flash가 뒤를 이어 있습니다. 결과는 프로페셔널 소프트웨어 엔지니어가 생산 환경에서 요구하는 기술과 AI의 능력 사이에 상당한 격차가 있음을 시사합니다.
| 순위 | 모델 | 해서스 | 해결률 |
|---|---|---|---|
| 1 | Fable 5.1 | Claude Code | 38.8% |
| 2 | GPT-6 Astra | Codex CLI | 33.8% |
| 3 | Gemini 3.8 Flash | Gemini CLI | 31.2% |
| 4 | GLM 5.3 | Claude Code | 28.8% |
| 5 | Grok 4.6 | Grok Build | 23.8% |
| 5 | Muse Spark 1.3 | Muse Code | 23.8% |
| 7 | Kimi K3 | Kimi Code | 18.8% |
| 8 | GPT-5.6 Sol | Codex CLI | 16.2% |
해결률은 각 작업당 8회 독립 실행된 pass@1 평균값으로 계산됩니다.
기업 코드베이스가 더 도전적인 이유
Real-SWE 작업은 실제 기업의 라이선스된 사내 코드베이스를 활용하기 때문에 AI 모델에게 "분포 외"(out of distribution) 상태가 되도록 설계되었습니다. 이는 모델이 공개 인터넷에서 찾을 수 있는 학습 데이터에 의존하는 것을 방지합니다.
기업 고유의 복잡성
기업 엔지니어링은 문법 지식 이상을 요구합니다. 내부 코딩 패턴과 기업 규칙을 이해하는 것이 필요합니다. 예를 들어, 한 작업은 인보이스 청구를 수정하는 것으로, 에이전트는 NestJS/TypeScript 서비스를 탐색하고 TaxJar 및 InfluxDB와 같은 외부 서비스와 상호작용하여 특정 기업 설정에 따라 세금 면제 및 부가세 등록을 처리해야 합니다.
다기능 구현
현실 세계의 변경은 단일 파일 내에 국한되지 않습니다. Real-SWE 참조 솔루션에서 편집된 파일의 중앙값은 11개이며, FrontierCode 및 DeepSWE와 같은 다른 벤치마크의 중앙값인 6개보다 높습니다. 이는 에이전트가 AWS, Kubernetes, PostgreSQL, Redis와 같은 여러 서비스 및 인프라 구성 요소를 통해 시스템에 대한 정신적 지도를 유지해야 함을 의미합니다.
모델 실패 분석
실패 분석 결과, 실패의 가장 흔한 원인은 "요구사항 누락"이며, 그 다음은 "검증되지 않은 가정"입니다. 이는 모델이 코드를 작성할 수는 있지만, 비즈니스 의도를 완전히 이해하거나 기존 시스템과의 변경 사항을 검증하는 데 어려움을 겪고 있음을 시사합니다.
작업별 변동성
성능은 작업에 따라 극심하게 달라집니다. "다중 영역 스위프" 작업은 67.2%의 해결률을 기록하지만, "분석 스트림 리듀서" 작업은 모든 테스트 모델에서 0.0%의 해결률을 기록합니다. 이는 특정 유형의 복잡한 비즈니스 로직이나 아키텍처 패턴이 현재 최첨단 모델에게는 완전히 해결 불가능하다는 점을 시사합니다.
배포 기간 및 비용
작업에 소요된 시간과 성공률 사이에 거의 상관관계가 없습니다. 10분 미만의 배포 중 71.4%가 실패했으며, 장시간 배포 중 73.4%가 실패했습니다. 배포당 추정 비용은 Gemini 3.8 Flash의 $2.50에서 Fable 5.1의 $6.96까지 다양합니다.
커뮤니티의 통찰과 반론
Hacker News에서 엔지니어들 간의 논의는 벤치마크 결과와 개인 사용자 경험 사이의 갈등을 드러냅니다.
도구와 맥락
일부 사용자는 에이전트의 성공 여부가 해서스와 모델에 제공되는 "맥락 지도"에 더 크게 의존한다고 주장합니다. 한 사용자는 "코드 아틀라스"—코드베이스 연결을 의미적으로 쿼리 가능한 지도—를 구축하면 모델이 코드를 읽는 데 소요하는 시간을 크게 줄이고 세부 사항에 대한 인식을 향상시킬 수 있다고 제안했습니다.
방법론에 대한 우려
벤치마크에 대한 비판자들은 코드베이스가 사내이기 때문에 재현 불가능하며, "핑키-프라미스 벤치마크"의 가능성에 주목했습니다.
"TL;DR 완전히 재현 불가능한 방식으로 벤치마크를 하는 것인가요? '모델 X는 훌륭하게 작동했지만, 그 코드가 어떤 회사의 큰 코드베이스였는지 외에는 아무것도 알려줄 수 없습니다.'"
또한 일부 사용자는 사내 코드베이스가 진정으로 사내인지, 아니면 최첨단 모델의 학습 데이터셋에 유출되었는지에 대해 의문을 제기하며, 현대 LLM 평가에서 오염이 지속적인 위험임을 지적했습니다.
실용적 관찰
몇몇 사용자는 Gemini 3.8 Flash가 이 벤치마크에서 높은 성능을 보인 것이 자신의 경험과 일치한다고 지적하며, 명확하게 정의된 기업 환경에서 문제를 해결하는 데 "숨겨진 보석"처럼 작용한다고 설명했습니다. 비록 개방형 질문에서는 어려움을 겪지만 말이죠.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch