SWE-bench/SWE-bench

SWE-bench: Can Language Models Resolve Real-world Github Issues?

해결하는 문제

SWE-bench는 대규모 언어 모델(LLMs)이 실제 소프트웨어 엔지니어링 문제를 해결할 수 있는 능력을 평가하기 위해 설계되었습니다. 단순한 코드 조각을 넘어서, AI가 전체 코드베이스를 다루고 실제 GitHub 이슈에 대한 기능적인 패치를 생성할 수 있는지 테스트합니다.

작동 방식

이 벤치마크는 실제 GitHub 이슈와 해당 코드베이스의 세트를 제공합니다. 모델은 코드베이스와 이슈 설명을 받고, 문제를 해결하는 코드 패치(diff)를 생성해야 합니다. 시스템은 Docker를 통해 완전히 컨테이너화된 평가 환경을 사용하여 생성된 패치가 재현 가능하게 문제를 해결하는지 실행 및 검증합니다.

대상 사용자

소프트웨어 엔지니어링 에이전트나 코딩에 특화된 LLM을 개발하는 AI 연구자 및 개발자에게 주로 적합합니다. 복잡한 실제 세계의 소프트웨어 버그를 해결할 수 있는 모델의 능력을 표준화된 방식으로 측정하고자 하는 사람들에게 적합합니다.

주요 특징

  • 실제 세계 데이터: 인공적인 작업이 아닌 실제 GitHub 이슈와 코드베이스를 사용합니다.
  • 컨테이너 기반 평가: Docker를 사용하여 평가를 재현 가능하고 격리된 환경에서 수행합니다.
  • 다양한 데이터셋: SWE-bench Verified(인간이 확인한 해결 가능한 문제), Multimodal(시각적 소프트웨어 영역), Multilingual 등의 전문화된 버전을 포함합니다.
  • 클라우드 통합: Modal 및 sb-cli를 통해 클라우드 기반 평가를 지원합니다.
  • 학습 지원: 사전 처리된 데이터셋과 기존 모델에서의 학습 및 추론을 위한 도구를 제공합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트