datacurve-ai/deep-swe

Measuring frontier coding agents on original, long-horizon engineering tasks

해결하는 문제

DeepSWE는 선도적인 코딩 에이전트의 성능을 측정하기 위한 표준화된 방법을 제공합니다. 단순한 스니펫이나 합성 테스트가 아니라, 실제 오픈소스 리포지토리에서 나온 원본이며 장기적인 소프트웨어 엔지니어링 작업을 사용하는 벤치마크의 필요성을 해결합니다.

작동 방식

DeepSWE는 TypeScript, Go, Python, JavaScript, Rust의 다섯 가지 언어에 걸쳐 113개의 작업으로 구성되어 있습니다. 각 작업은 메타데이터, 지침, 격리된 환경을 포함한 Harbor 작업 형식으로 패키지화됩니다. 공정하고 객관적인 평가를 위해, 코드의 작성 방식과 무관하게 에이전트의 관찰 가능한 동작이 올바른지 확인하는 프로그램 기반 검증기를 사용합니다. 일반적으로 Pier라는 프레임워크를 사용하여 실행되며, 사전 환경과 네트워크 허용 목록을 제공하여 작업을 격리하면서도 에이전트가 LLM API와 통신할 수 있도록 합니다.

대상 사용자

복잡하고 다단계적인 소프트웨어 엔지니어링 작업을 실제 환경에서 처리할 수 있는 능력을 평가하고자 하는 개발자 및 연구자.

주요 특징

  • 실제 세계의 작업: 작업은 활발히 개발 중인 오픈소스 리포지토리에서 가져옵니다.
  • 다중 언어 지원: TypeScript, Go, Python, JavaScript, Rust를 지원합니다.
  • 다중 모달 평가: 격리된 컨테이너와 프로그램 기반 검증기를 사용하여 정확성을 보장합니다.
  • 사전 실행 환경: Pier와 통합되어 에이전트 실행을 위한 안전하고 격리된 환경을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch