datacurve-ai/deep-swe

Measuring frontier coding agents on original, long-horizon engineering tasks

解決的問題

DeepSWE 提供了一種標準化的方法,用於衡量前沿編碼代理的表現。它解決了對基準測試的需求,這些基準測試使用來自真實世界開源倉庫的原始、長期的軟體工程任務,而非簡單的程式碼片段或合成測試。

工作原理

DeepSWE 包含 113 個任務,涵蓋五種語言(TypeScript、Go、Python、JavaScript 和 Rust)。每個任務均以 Harbor 任務格式打包,包含元資料、指示與隔離環境。為確保公平且客觀的評分,它使用基於程式的驗證器,檢查代理的可觀測行為是否正確,而不受程式碼撰寫方式的影響。通常透過 Pier 框架執行,該框架提供沙箱環境與網路允許清單,以保持任務隔離,同時允許代理與 LLM API 通訊。

適用對象

需要評估其在真實環境中處理複雜、多步驟軟體工程任務能力的開發者與研究人員,專注於編碼代理與 LLM 的開發。

主要亮點

  • 真實世界任務:任務來自活躍的開源倉庫。
  • 多語言支援:涵蓋 TypeScript、Go、Python、JavaScript 和 Rust。
  • 多模態評分:使用隔離容器與基於程式的驗證器確保正確性。
  • 沙箱執行:與 Pier 整合,提供安全、隔離的代理執行環境。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch