augmentcode/augment-swebench-agent
The #1 open-source SWE-bench Verified implementation
解決的問題
本專案提供一個專為解決複雜軟體工程任務而設計的程式碼代理,特別針對 SWE-bench Verified 基準中的任務。與簡單的程式碼挑戰不同,這些任務要求代理能導航整個程式碼庫,根據回歸測試進行迭代,並處理真實 GitHub 問題的複雜性。
作法原理
該代理以 Claude 3.7 Sonnet 為主要驅動,並基於 Anthropic 的架構分叉而來。它透過執行 bash 命令、檔案編輯,以及複雜問題解決的「順序思考」流程來運作。為提升準確性,系統採用由 OpenAI 的 o1 提供支援的多數決集成器,分析代理產生的多個候選解決方案,並選出最佳方案。
適用對象
適合希望取得即用型軟體工程基準代理的開發者與 AI 研究人員,或尋找簡單且可擴展框架來建構與測試自身程式碼代理的人。
特色
- 整合工具集:內建 bash 執行、檔案操作與順序思考功能。
- 集成邏輯:使用多數決機制,從多個候選方案中選出最高品質的解決方案。
- Docker 整合:於 Docker 容器中執行,確保程式碼執行的安全性與隔離性。
- 彈性模式:支援互動式 CLI 用於個人協助,也支援非互動模式,用於在 SWE-bench 上進行大規模評估。
相關
- 專案
- 專案
- Dispatch
- Dispatch
- Dispatch