augmentcode/augment-swebench-agent

The #1 open-source SWE-bench Verified implementation

解決的問題

本專案提供一個專為解決複雜軟體工程任務而設計的程式碼代理,特別針對 SWE-bench Verified 基準中的任務。與簡單的程式碼挑戰不同,這些任務要求代理能導航整個程式碼庫,根據回歸測試進行迭代,並處理真實 GitHub 問題的複雜性。

作法原理

該代理以 Claude 3.7 Sonnet 為主要驅動,並基於 Anthropic 的架構分叉而來。它透過執行 bash 命令、檔案編輯,以及複雜問題解決的「順序思考」流程來運作。為提升準確性,系統採用由 OpenAI 的 o1 提供支援的多數決集成器,分析代理產生的多個候選解決方案,並選出最佳方案。

適用對象

適合希望取得即用型軟體工程基準代理的開發者與 AI 研究人員,或尋找簡單且可擴展框架來建構與測試自身程式碼代理的人。

特色

  • 整合工具集:內建 bash 執行、檔案操作與順序思考功能。
  • 集成邏輯:使用多數決機制,從多個候選方案中選出最高品質的解決方案。
  • Docker 整合:於 Docker 容器中執行,確保程式碼執行的安全性與隔離性。
  • 彈性模式:支援互動式 CLI 用於個人協助,也支援非互動模式,用於在 SWE-bench 上進行大規模評估。

相關

  • 專案
  • 專案
  • Dispatch
  • Dispatch
  • Dispatch