SWE-agent/SWE-agent

SWE-agent takes a GitHub issue and tries to automatically fix it, using your LM of choice. It can also be employed for offensive cybersecurity or competitive coding challenges. [NeurIPS 2024]

What it solves

SWE-agent はソフトウェアエンジニアリングタスクの自動化を目的としています。大規模言語モデル(LLM)が実際の GitHub リポジトリ内の課題を自律的に修正したり、サイバーセキュリティ脆弱性を特定したり、カスタムコーディングチャレンジを実行したりできます。

How it works

システムは、選択された言語モデル(例: GPT-4o や Claude Sonnet 4)がツールを使ってコードベースとやり取りできるようにします。単一の YAML ファイルで高度に構成可能で、研究目的のためにシンプルかつハックしやすい設計となっており、問題解決のためのモデルの裁量を最大化します。

Who it’s for

バグ修正、脆弱性スキャン、その他複雑なコーディングタスクを自動化したいソフトウェアエンジニア、AI 研究者、サイバーセキュリティ専門家向けです。

Highlights

  • State of the Art: オープンソースプロジェクトの中で SWE-bench ベンチマークで最高性能を達成。
  • Cybersecurity Focus: 攻撃的サイバーセキュリティ(CTF)課題を解くための専用モード EnIGMA を搭載。
  • Flexible: 様々な LLM をサポートし、設定が容易になるよう完全にドキュメント化。
  • Research-Oriented: プリンストン大学とスタンフォード大学の研究者によって開発。