OpenAI SWE-Lancer 基准发布
OpenAI 已发布 SWE-Lancer,一个由超过 1,400 个来自 Upwork 的自由职业软件工程任务组成的基准。此基准使研究人员能够评估 AI 模型解决真实世界、付费软件工程问题的能力,将模型性能直接映射到货币价值,以评估 AI 开发的经济影响。
SWE-Lancer 的技术组成
SWE-Lancer 包含反映实际专业软件工程工作的多样化任务范围。该基准被划分为两个主要工作类别:
独立工程任务
这些任务在复杂性和价值上从价值 50 美元的小错误修复到价值高达 32,000 美元的大规模功能实现不等。这些任务通过经验丰富的软件工程师三次验证的端到端测试进行评分,以确保准确性。
管理任务
除了技术实现之外,SWE-Lancer 还包括管理任务,在这些任务中,模型必须在不同的技术实现方案之间进行选择。这些决策将与原始雇佣的工程经理所做的相同选择进行评估。
模型性能与评估
OpenAI 报告称,前沿模型目前无法解决 SWE-Lancer 基准中的大多数任务。这表明当前 AI 能力与自由职业工作所需的专业软件工程标准之间存在显著差距。
研究可访问性与更新
为了支持研究社区,OpenAI 已开源一个统一的 Docker 镜像和一个称为 SWE-Lancer Diamond 的公开评估划分。
2025年7月28日的更新指出,数据集和结果已于2025年7月17日更新。此更新移除了执行期间对互联网连接的要求,旨在消除模型性能的主要变异来源。更新后的数据集和结果可通过 OpenAI preparedness GitHub repository 获得。
经济影响映射
通过利用总计 100 万美元的真实世界付款任务,SWE-Lancer 被设计用于促进对 AI 驱动的软件工程经济价值的研究,为模型性能改进提供货币度量。