SWE-bench/SWE-smith

[NeurIPS 2025 D&B Spotlight] Scaling Data for SWE-agents

它解決了什麼問題

SWE‑smith 旨在解決訓練軟體工程(SWE)代理時的資料稀缺問題。它提供一套工具組,透過自動將 GitHub 倉庫轉換為互動式訓練環境(SWE‑gyms)並合成無限的任務實例,讓代理可以大量練習,從而大規模產出高品質的訓練資料。

它如何運作

此工具組使用 Docker 為各種倉庫建立隔離的執行環境。它遵循四步流程來建構資料集:

  1. 環境建構:為倉庫建立基於 Docker 的執行環境。
  2. 任務合成:自動產生任務實例(例如程式修復或檔案定位)。
  3. 任務驗證:過濾任務,只保留會使至少一個單元測試失敗的任務,以確保其功能性。
  4. 議題生成:產生代理必須解決的描述性議題文字。

目標使用者

主要針對 AI 研究者與開發者,特別是使用 SWE‑agent 框架,致力於建構與訓練大型語言模型(LLM)以成為自主軟體工程師的人員。

重點特色

  • 可擴展的資料生成:能將任何 GitHub 倉庫轉換為 SWE 代理的訓練場域。
  • 資源整理:提供 52k 任務實例與 26k 軌跡的資料集。
  • 驗證效能:用於微調 Qwen 2.5 Coder 成為 SWE‑agent‑LM‑32B,於 SWE‑bench Verified 上提升了 +32%。
  • 支援 RL:相容於如 GRPO 等強化學習技術,透過 SkyRL 使用。