SWE-bench/SWE-smith

[NeurIPS 2025 D&B Spotlight] Scaling Data for SWE-agents

解決する課題

SWE‑smith は、ソフトウェアエンジニアリング(SWE)エージェントのトレーニングにおけるデータ不足問題を解決するために設計されました。GitHub リポジトリを自動的にインタラクティブなトレーニング環境(SWE‑gyms)に変換し、エージェントが練習できる無限のタスクインスタンスを合成することで、高品質なトレーニングデータの大量生成を可能にします。

仕組み

このツールキットは Docker を使用して各リポジトリの隔離実行環境を作成します。データセット構築は以下の 4 ステップで行われます:

  1. 環境構築:リポジトリ用の Docker ベース実行環境を作成。
  2. タスク合成:プログラム修正やファイルローカライズなどのタスクインスタンスを自動生成。
  3. タスク検証:少なくとも 1 つのユニットテストを失敗させるタスクだけを残すことで、機能的であることを保証。
  4. Issue 生成:エージェントが解決すべき記述的な Issue テキストを作成。

対象ユーザー

主に AI 研究者や開発者向けで、SWE‑agent フレームワークを使用して自律的なソフトウェアエンジニアとして機能する大規模言語モデル(LLM)を構築・トレーニングする人々を対象としています。

ハイライト

  • スケーラブルなデータ生成:任意の GitHub リポジトリを SWE エージェントのトレーニング場に変換可能。
  • リソースのキュレーション:52k のタスクインスタンスと 26k のトラジェクトリからなるデータセットを提供。
  • 実績のある性能:Qwen 2.5 Coder を SWE‑agent‑LM‑32B にファインチューニングし、SWE‑bench Verified で +32% の向上を達成。
  • RL サポート:GRPO などの強化学習手法に対応し、SkyRL 経由で利用可能。