OpenAI SWE-Lancer 基準測試發布
OpenAI 已發布 SWE-Lancer,一個基準測試,包含超過 1,400 個來自 Upwork 的自由職業軟體工程任務。此基準測試使研究人員能夠評估 AI 模型解決真實世界、付費軟體工程問題的能力,將模型效能直接映射到貨幣價值,以評估 AI 開發的經濟影響。
SWE-Lancer 的技術組成
SWE-Lancer 包含多樣化的任務範圍,反映實際的專業軟體工程工作。該基準測試分為兩個主要工作類別:
獨立工程任務
這些任務在複雜度和價值上範圍廣泛,從價值 50 美元的小型錯誤修復到價值高達 32,000 美元的大規模功能實作。這些任務經過經驗豐富的軟體工程師三重驗證的端到端測試進行評分,以確保準確性。
管理任務
除了技術實作之外,SWE-Lancer 還包含管理任務,模型必須在不同的技術實作方案之間進行選擇。這些決策會與原始雇用的工程經理所做的相同選擇進行評估。
模型效能與評估
OpenAI 報告指出,目前的前沿模型無法解決 SWE-Lancer 基準測試中大部分的任務。這表明當前 AI 能力與自由職業軟體工程所需的專業軟體工程標準之間存在顯著差距。
研究可及性與更新
為了支援研究社群,OpenAI 已開源一個統一的 Docker 映像和一個名為 SWE-Lancer Diamond 的公開評估分割。
2025 年 7 月 28 日的更新指出,資料集與結果已於 2025 年 7 月 17 日進行更新。此更新移除了執行期間的網路連線需求,旨在消除模型效能的一主要變異來源。更新後的資料集與結果可透過 OpenAI preparedness GitHub 倉庫取得。
經濟影響映射
透過使用總計 100 萬美元的真實世界付款任務,SWE-Lancer 的設計旨在啟用對 AI 驅動軟體工程經濟價值的研究,提供模型效能提升的貨幣度量。