SWE-bench/SWE-bench

SWE-bench: Can Language Models Resolve Real-world Github Issues?

何を解決するか

SWE-bench は、大規模言語モデル(LLMs)が実世界のソフトウェアエンジニアリングの問題を解決できるかを評価するためのものである。単純なコードスニペットを越えて、AIが実際のコードベースを扱い、GitHubの実際の問題に対して機能的なパッチを生成できるかをテストする。

動作方法

ベンチマークは、実際のGitHubの問題とそれに対応するコードベースのセットを提供する。モデルはコードベースと問題の説明を受け取り、問題を解決するコードパッチ(diff)を生成しなければならない。システムはDockerを用いた完全にコンテナ化された評価ハーネスを使用して、生成されたパッチが再現可能に問題を修正するかを実行・検証する。

対象ユーザー

ソフトウェアエンジニアリングエージェントやコーディングに特化したLLMを開発するAI研究者や開発者向け。複雑な実世界のバグを解決する能力を標準化された方法で測定したい人にとって最適である。

特徴

  • 実世界のデータ: 人工的なタスクではなく、実際のGitHubの問題とコードベースを使用。
  • コンテナ化された評価: Dockerを用いて評価を再現可能かつ隔離された環境で実施。
  • 多様なデータセット: SWE-bench Verified(人間が確認済みの解決可能な問題)、Multimodal(視覚的ソフトウェア分野)、Multilingual などの専門バージョンを含む。
  • クラウド統合: Modal および sb-cli を通じたクラウドベースの評価をサポート。
  • トレーニング支援: 事前処理済みデータセットと既存モデルでのトレーニング・推論用ツールを提供。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト