SWE-bench/SWE-smith

[NeurIPS 2025 D&B Spotlight] Scaling Data for SWE-agents

해결하고자 하는 문제

SWE‑smith는 소프트웨어 엔지니어링(SWE) 에이전트를 학습시키기 위한 데이터 부족 문제를 해결하도록 설계되었습니다. GitHub 리포지토리를 자동으로 인터랙티브한 학습 환경(SWE‑gyms)으로 변환하고, 에이전트가 연습할 수 있는 무한한 작업 인스턴스를 합성함으로써 고품질 학습 데이터를 대규모로 생산할 수 있는 툴킷을 제공합니다.

작동 방식

이 툴킷은 Docker를 사용해 다양한 리포지토리마다 격리된 실행 환경을 생성합니다. 데이터셋 구축은 네 단계 프로세스를 따릅니다:

  1. 환경 구축: 리포지토리를 위한 Docker 기반 실행 환경을 생성합니다.
  2. 작업 합성: 프로그램 수리나 파일 위치 찾기와 같은 작업 인스턴스를 자동으로 생성합니다.
  3. 작업 검증: 최소 하나의 단위 테스트를 실패시키는 작업만 남겨 기능성을 보장합니다.
  4. 이슈 생성: 에이전트가 해결해야 할 설명형 이슈 텍스트를 만듭니다.

대상 사용자

주로 AI 연구자와 개발자를 위한 것으로, SWE‑agent 프레임워크를 사용해 자율 소프트웨어 엔지니어 역할을 수행하는 대형 언어 모델(LLM)을 구축·학습하는 사람들을 대상으로 합니다.

주요 특징

  • 확장 가능한 데이터 생성: 모든 GitHub 리포지토리를 SWE 에이전트의 학습 장으로 전환할 수 있습니다.
  • 리소스 큐레이션: 52k 작업 인스턴스와 26k 트래젝터리 데이터셋을 제공합니다.
  • 검증된 성능: Qwen 2.5 Coder를 SWE‑agent‑LM‑32B로 파인튜닝하여 SWE‑bench Verified에서 +32% 향상을 달성했습니다.
  • RL 지원: GRPO와 같은 강화학습 기법과 호환되며 SkyRL을 통해 사용할 수 있습니다.