datacurve-ai/deep-swe

Measuring frontier coding agents on original, long-horizon engineering tasks

何を解決するか

DeepSWEは、先端的なコーディングエージェントのパフォーマンスを測定するための標準化された方法を提供します。実世界のオープンソースリポジトリから抽出されたオリジナルで長期間にわたるソフトウェアエンジニアリングタスクを用いるベンチマークの必要性に対応しており、単純なスニペットや合成テストではなく、本物の開発課題を評価します。

仕組み

DeepSWEは、5つの言語(TypeScript、Go、Python、JavaScript、Rust)にまたがる113のタスクから構成されています。各タスクは、メタデータ、指示、および隔離された環境を含むHarborタスク形式でパッケージ化されています。公正かつ客観的な採点を実現するために、コードの書き方に関係なく、エージェントの観察可能な振る舞いが正しいかを検証するプログラムベースの検証器を使用しています。通常、Pierというフレームワークを用いて実行され、サンドボックス環境とネットワーク許可リストを提供することで、タスクを隔離しつつ、エージェントがLLM APIと通信できるようにしています。

対象ユーザー

複雑で多段階のソフトウェアエンジニアリングタスクを実世界の環境で処理できる能力を評価したい、コーディングエージェントやLLMを開発・研究している開発者や研究者。

特徴

  • 実世界のタスク: タスクは、現在活発に開発されているオープンソースリポジトリから抽出されています。
  • 多言語対応: TypeScript、Go、Python、JavaScript、Rustをカバーしています。
  • マルチモーダル評価: 隔離されたコンテナとプログラムベースの検証器を用いて、正しさを保証します。
  • サンドボックス実行: Pierと統合され、エージェント実行に安全で隔離された環境を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch