augmentcode/augment-swebench-agent

The #1 open-source SWE-bench Verified implementation

해결하는 문제

이 프로젝트는 SWE-bench Verified 벤치마크에서 발견되는 복잡한 소프트웨어 엔지니어링 작업을 해결하기 위해 설계된 코딩 에이전트를 제공합니다. 단순한 코딩 문제와 달리, 이러한 작업은 에이전트가 전체 코드베이스를 탐색하고, 리그레션 테스트에 기반해 반복 작업하며, 실제 GitHub 이슈의 복잡성을 다뤄야 합니다.

작동 방식

에이전트는 주로 Claude 3.7 Sonnet을 주 드라이버로 사용하며, Anthropic에서 파생된 아키텍처를 기반으로 합니다. bash 명령어 실행, 파일 편집, 복잡한 문제 해결을 위한 "순차적 사고" 프로세스와 같은 도구를 실행합니다. 정확도를 높이기 위해 OpenAI의 o1을 활용한 다수결 앙상블 시스템을 사용하여 에이전트가 생성한 여러 후보 해결책을 분석하고 가장 우수한 것을 선택합니다.

대상 사용자

소프트웨어 엔지니어링 벤치마크용 즉시 사용 가능한 베이스라인 에이전트가 필요한 개발자나 AI 연구자, 또는 자신만의 코딩 에이전트를 구축하고 테스트할 수 있는 간단하고 확장 가능한 프레임워크를 찾는 사람들을 위한 것입니다.

주요 특징

  • 통합 도구 세트: bash 실행, 파일 조작, 순차적 사고 기능을 내장하고 있습니다.
  • 앙상블 로직: 여러 후보 해결책 중 가장 고품질의 해결책을 다수결로 선택합니다.
  • Docker 통합: 코드 실행을 안전하고 격리된 환경에서 수행하기 위해 Docker 컨테이너 내에서 작동합니다.
  • 유연한 모드: 개인용 인터랙티브 CLI와 SWE-bench에서 대규모 평가를 수행할 수 있는 비인간적 모드를 모두 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch
  • Dispatch