Real-SWE Benchmark: Evaluating AI Coding Agents on Private Enterprise Codebases
Real-SWE 基准测试揭示,前沿 AI 编程智能体在处理私有、真实的商业企业代码库时面临显著挑战。虽然合成基准测试通常显示出很高的成功率,但 Real-SWE 表明,向专有系统(即代码在公共互联网上不可用,且业务逻辑与基础设施深度交织)的转变,使得所有测试模型的解决率都降至 40% 以下。
Model Performance and Leaderboard
Fable 5.1 以 38.8% 的解决率在基准测试中领先,紧随其后的是 GPT-6 Astra 和 Gemini 3.8 Flash。结果表明,AI 能力与生产环境中专业软件工程师的要求之间存在巨大差距。
| Rank | Model | Harness | Resolution Rate |
|---|---|---|---|
| 1 | Fable 5.1 | Claude Code | 38.8% |
| 2 | GPT-6 Astra | Codex CLI | 33.8% |
| 3 | Gemini 3.8 Flash | Gemini CLI | 31.2% |
| 4 | GLM 5.3 | Claude Code | 28.8% |
| 5 | Grok 4.6 | Grok Build | 23.8% |
| 5 | Muse Spark 1.3 | Muse Code | 23.8% |
| 7 | Kimi K3 | Kimi Code | 18.8% |
| 8 | GPT-5.6 Sol | Codex CLI | 16.2% |
解决率按 pass@1 计算,是每个任务八次独立运行的平均值。
Why Enterprise Codebases are More Challenging
Real-SWE 任务旨在为 AI 模型提供“分布外”挑战,因为它们使用了来自真实公司的授权私有代码库。这防止了模型依赖于在公共互联网上发现的训练数据。
Company-Specific Complexity
企业级工程不仅需要语法知识,还需要对内部编码模式和业务规则的理解。例如,其中一个任务涉及修复发票账单,智能体必须在 NestJS/TypeScript 服务中进行导航,并与 TaxJar 和 InfluxDB 等外部服务进行交互,以根据特定的业务配置处理税收豁免和增值税(VAT)注册。
Cross-Functional Implementation
现实世界的变更很少局限于单个文件。Real-SWE 参考解决方案中编辑的文件数量中位数为 11,而 FrontierCode 和 DeepSWE 等其他基准测试中的中位数仅为 6。这要求智能体必须在多个服务和基础设施组件(包括 AWS, Kubernetes, PostgreSQL, 和 Redis)之间维持一个系统的思维导图。
Analysis of Model Failures
失败分析显示,最常见的失败原因是“错失需求”,其次是“未经验证的假设”。这表明,虽然模型可以编写代码,但它们难以完全理解业务意图并根据现有系统验证其更改。
Task-Specific Variance
性能因任务而异。虽然像 “Multi-region sweep” 这样的任务具有 67.2% 的解决率,但其他任务如 “Analytics stream reducer” 在所有测试模型中的解决率均为 0.0%。这表明,某些类型的复杂业务逻辑或架构模式对于当前的前沿模型来说仍然是完全无法解决的。
Rollout Duration and Cost
任务执行时间与成功率之间几乎没有相关性;10 分钟以下的执行时间中,71.4% 失败了,而时间较长的执行时间中,失败率为 73.4%。每次执行的估计成本从 $2.50 (Gemini 3.8 Flash) 到 $6.96 (Fable 5.1) 不等。
Community Insights and Counterpoints
Hacker News 上的工程师讨论突显了基准测试结果与个人用户体验之间的分歧。
Tooling and Context
一些用户认为,智能体的成功取决于更多地依赖于 harness 和提供给模型的 “context map”。一位用户建议,构建一个 “code atlas”——即一种语义可查询的代码库连接图谱,可以极大地减少模型阅读代码的时间并提高其对细微差别的意识。
Methodology Concerns
基准测试的批评者指出,缺乏可重复性,并且由于代码库是私有的,存在 “pinky-promise benchmarking” 的可能性。
"TL;DR benchmarking in a completely non-reproducible manner? 'Model X performed great, but we can't possibly tell you anything about the code it was looking at apart from it was a large code base from an unknown company'."
此外,一些用户质疑私有代码库是否真的私有,或者它们是否已经泄露到了前沿模型的训练集中,暗示污染 contamination 风险在现代 LLM 评估中是一个持续存在的风险。
Practical Observations
几位用户指出,Gemini 3.8 Flash 在此基准测试中的高性能表现与他们的个人经验一致,将其描述为在定义明确的企业级环境解决问题时的 “hidden gem”,即使它在处理开放式问题时表现不佳。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch