Real-SWE Benchmark: Evaluating AI Coding Agents on Private Enterprise Codebases
Real-SWE benchmark 揭示了頂尖 AI 編碼代理在處理私有、真實世界的企業代碼庫時面臨顯著的挑戰。雖然合成基準測試通常顯示出高成功率,但 Real-SWE 證明了向專有系統的轉移——即代碼無法在公開網際網路獲取,且業務邏輯與基礎設施深度交織——會使所有測試模型的解決率降至 40% 以下。
Model Performance and Leaderboard
Fable 5.1 以 38.8% 的解決率領先基準測試,緊隨其後的是 GPT-6 Astra 和 Gemini 3.8 Flash。結果顯示,AI 能力與生產環境中專業軟體工程師的需求之間存在巨大差距。
| Rank | Model | Harness | Resolution Rate |
|---|---|---|---|
| 1 | Fable 5.1 | Claude Code | 38.8% |
| 2 | GPT-6 Astra | Codex CLI | 33.8% |
| 3 | Gemini 3.8 Flash | Gemini CLI | 31.2% |
| 4 | GLM 5.3 | Claude Code | 28.8% |
| 5 | Grok 4.6 | Grok Build | 23.8% |
| 5 | Muse Spark 1.3 | Muse Code | 23.8% |
| 7 | Kimi K3 | Kimi Code | 18.8% |
| 8 | GPT-5.6 Sol | Codex CLI | 16.2% |
解決率是以 pass@1 計算,並對每個任務的八次獨立運行進行平均。
Why Enterprise Codebases are More Challenging
Real-SWE 任務旨在為 AI 模型提供「超出分佈」的挑戰,因為它們使用了來自真實公司的授權私有代碼庫。這防止了模型依賴於在公開網際網路中找到的訓練數據。
Company-Specific Complexity
企業工程需要的不僅僅是語法知識;它還需要對內部編碼模式和業務規則的理解。例如,其中一個任務涉及修復發票帳單,代理必須導航 NestJS/TypeScript 服務並與 TaxJar 和 InfluxDB 等外部服務進行交互,以根據特定的業務配置來處理稅務豁免和 VAT 註冊。
Cross-Functional Implementation
真實世界的變更很少僅限於單個文件。Real-SWE 參考解決方案中編輯的文件數量中位數為 11,而 FrontierCode 和 DeepSWE 等其他基準測試中為 6。這要求代理必須在多個服務和基礎設施組件(包括 AWS, Kubernetes, PostgreSQL, 和 Redis)之間維持一個系統的心理地圖。
Analysis of Model Failures
失敗分析顯示,最常見的失敗原因為「遺漏需求」,其次是「未經證實的假設」。這表明雖然模型可以編寫代碼,但它們難以完全掌握業務意圖,並根據現有系統驗證其變更。
Task-Specific Variance
性能表現因任務而異。雖然某些任務如「Multi-region sweep」具有 67.2% 的解決率,但其他任務如「Analytics stream reducer」在所有測試模型中的解決率均為 0.0%。這表明某些類型的複雜業務邏輯或架構模式對於目前的頂尖模型來說仍然是完全無法解決的。
Rollout Duration and Cost
在任務上花費的時間與成功率之間幾乎沒有相關性;71.4% 的低於 10 分鐘的 rollouts 失敗了,而較長的 rollouts 則失敗了 73.4%。每次 rollouts 的估計成本從 $2.50 (Gemini 3.8 Flash) 到 $6.96 (Fable 5.1) 不等。
Community Insights and Counterpoints
Hacker News 上的工程師討論突顯了基準測試結果與個人用戶體驗之間的分歧。
Tooling and Context
一些用戶認為,代理的成功與否更多地取決於 harness 和提供給模型的「上下文地圖 (context map)". 這一位用戶建議,建立一個「code atlas」——一個語義可查詢的代碼庫連接地圖——可以極大地減少模型閱讀代碼的內容,並提高其對細微差別的的察覺力。
Methodology Concerns
對該基準測試的批評者指出其缺乏可重複性,且由於代碼庫是私有的,存在「pinky-promise benchmarking」的可能性。
"TL;DR benchmarking in a completely non-reproducible manner? 'Model X performed great, but we can't possibly tell you anything about the code it was looking at apart from it was a large code base from an unknown company'."
此外,一些用戶質疑私有代碼庫是否真的私有,或者它們是否已經洩露到頂尖模型的訓練集中,這表明數據污染是現代 LLM 評估中的一個常態性風險。
Practical Observations
幾位用戶指出 Gemini 3.8 Flash 在此基準測試中的高性能表現與其自身的經驗一致,將其描述為在定義良好的企業環境中解決問題的「隱藏寶藏 (hidden gem)", even if it struggles with open-ended questions.
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch