datacurve-ai/deep-swe

Measuring frontier coding agents on original, long-horizon engineering tasks

解决的问题

DeepSWE 为衡量前沿编码代理的性能提供了一种标准化方法。它解决了需要使用来自真实世界开源仓库的原始、长周期软件工程任务作为基准的迫切需求,而非简单的代码片段或合成测试。

工作原理

DeepSWE 包含 113 个任务,覆盖五种语言(TypeScript、Go、Python、JavaScript 和 Rust)。每个任务均采用 Harbor 任务格式打包,包含元数据、指令和隔离环境。为确保公平且客观的评分,它使用基于程序的验证器来检查代理的可观测行为是否正确,而不受代码编写方式的影响。通常通过 Pier 框架运行,该框架提供沙箱环境和网络白名单,以在保持任务隔离的同时允许代理与 LLM API 通信。

适用对象

需要评估其在真实环境中处理复杂、多步骤软件工程任务能力的编码代理和 LLM 开发者与研究人员。

主要亮点

  • 真实世界任务:任务源自活跃的开源仓库。
  • 多语言支持:涵盖 TypeScript、Go、Python、JavaScript 和 Rust。
  • 多模态评分:使用隔离容器和基于程序的验证器确保正确性。
  • 沙箱执行:与 Pier 集成,提供安全、隔离的代理执行环境。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch