SWE-bench/SWE-bench

SWE-bench: Can Language Models Resolve Real-world Github Issues?

解决的问题

SWE-bench 旨在评估大语言模型(LLMs)解决真实世界软件工程问题的能力。它超越了简单的代码片段,测试 AI 是否能够处理完整的代码库,并为实际的 GitHub 问题生成可运行的补丁。

工作原理

该基准提供了一组真实世界的 GitHub 问题及其对应的代码库。模型会收到代码库和问题描述,必须生成一个代码补丁(diff)来解决该问题。系统通过 Docker 实现完全容器化的评估环境,执行并验证生成的补丁是否能以可复现的方式真正修复问题。

适用对象

主要面向开发软件工程代理或专注于编程的 LLM 的 AI 研究人员和开发者,他们需要一种标准化的方法来衡量模型解决复杂真实世界软件缺陷的能力。

主要亮点

  • 真实世界数据:使用真实的 GitHub 问题和代码库,而非合成任务。
  • 容器化评估:使用 Docker 确保评估过程可复现且环境隔离。
  • 多样化数据集:包含 SWE-bench Verified(经人工确认可解决的问题)、Multimodal(视觉软件领域)、Multilingual 等专用版本。
  • 云集成:支持通过 Modal 和 sb-cli 进行云上评估。
  • 训练支持:提供预处理的数据集和用于现有模型训练与推理的工具。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目