SWE-bench/SWE-smith

[NeurIPS 2025 D&B Spotlight] Scaling Data for SWE-agents

它解决了什么

SWE‑smith 旨在解决训练软件工程(SWE)代理时的数据稀缺问题。它提供一个工具包,通过自动将 GitHub 仓库转化为交互式训练环境(SWE‑gyms)并合成无限的任务实例,让代理可以大量练习,从而规模化生成高质量的训练数据。

它是如何工作的

该工具包使用 Docker 为各种仓库创建隔离的执行环境。它遵循四步流程来构建数据集:

  1. 环境构建:为仓库创建基于 Docker 的执行环境。
  2. 任务合成:自动生成任务实例(如程序修复或文件定位)。
  3. 任务验证:过滤任务,只保留会导致至少一个单元测试失败的任务,以确保其功能性。
  4. Issue 生成:生成代理必须解决的描述性 Issue 文本。

适用人群

主要面向 AI 研究者和开发者,尤其是使用 SWE‑agent 框架,致力于构建和训练大型语言模型(LLM)以充当自主软件工程师的人群。

亮点

  • 可扩展的数据生成:能够将任何 GitHub 仓库转化为 SWE 代理的训练场。
  • 资源整理:提供 52k 任务实例和 26k 轨迹的数据集。
  • 验证性能:用于微调 Qwen 2.5 Coder 成为 SWE‑agent‑LM‑32B,在 SWE‑bench Verified 上提升了 +32%。
  • RL 支持:兼容如 GRPO 等强化学习技术,通过 SkyRL 使用。