datacurve-ai/deep-swe
Measuring frontier coding agents on original, long-horizon engineering tasks
解决的问题
DeepSWE 为衡量前沿编码代理的性能提供了一种标准化方法。它解决了需要使用来自真实世界开源仓库的原始、长周期软件工程任务作为基准的迫切需求,而非简单的代码片段或合成测试。
工作原理
DeepSWE 包含 113 个任务,覆盖五种语言(TypeScript、Go、Python、JavaScript 和 Rust)。每个任务均采用 Harbor 任务格式打包,包含元数据、指令和隔离环境。为确保公平且客观的评分,它使用基于程序的验证器来检查代理的可观测行为是否正确,而不受代码编写方式的影响。通常通过 Pier 框架运行,该框架提供沙箱环境和网络白名单,以在保持任务隔离的同时允许代理与 LLM API 通信。
适用对象
需要评估其在真实环境中处理复杂、多步骤软件工程任务能力的编码代理和 LLM 开发者与研究人员。
主要亮点
- 真实世界任务:任务源自活跃的开源仓库。
- 多语言支持:涵盖 TypeScript、Go、Python、JavaScript 和 Rust。
- 多模态评分:使用隔离容器和基于程序的验证器确保正确性。
- 沙箱执行:与 Pier 集成,提供安全、隔离的代理执行环境。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch