augmentcode/augment-swebench-agent

The #1 open-source SWE-bench Verified implementation

解决的问题

该项目提供了一个用于解决复杂软件工程任务的编码代理,特别针对 SWE-bench Verified 基准中的任务。与简单的编码挑战不同,这些任务要求代理能够导航整个代码库,根据回归测试进行迭代,并处理真实 GitHub 问题的复杂性。

工作原理

该代理以 Claude 3.7 Sonnet 为主要驱动,并基于 Anthropic 的架构 fork 而来。它通过执行 bash 命令、文件编辑以及复杂的“顺序思考”过程来运作。为了提高准确性,系统采用由 OpenAI 的 o1 提供支持的多数票集成器,分析代理生成的多个候选解决方案,并选择最佳方案。

适用人群

适用于希望获得即用型软件工程基准代理的开发者和 AI 研究人员,或希望使用简单且可扩展的框架来构建和测试自己编码代理的人。

亮点

  • 集成工具集:内置 bash 执行、文件操作和顺序思考功能。
  • 集成逻辑:使用多数票机制从多个候选方案中选择最高质量的解决方案。
  • Docker 集成:在 Docker 容器中运行,确保代码执行的安全性和隔离性。
  • 灵活模式:支持交互式 CLI 用于个人辅助,也支持非交互模式用于在 SWE-bench 上进行大规模评估。

相关

  • 项目
  • 项目
  • Dispatch
  • Dispatch
  • Dispatch