OpenAI SWE-Lancer ベンチマーク リリース

OpenAIは、Upworkからの1,400件以上のフリーランスソフトウェアエンジニアリングタスクからなるベンチマークであるSWE-Lancerをリリースしました。このベンチマークは、研究者が実際の有償ソフトウェアエンジニアリング問題を解決するAIモデルの能力を評価できるようにし、モデルのパフォーマンスを直接金銭的価値にマッピングしてAI開発の経済的影響を評価します。

SWE-Lancerの技術的構成

SWE-Lancerは、実際のプロフェッショナルなソフトウェアエンジニアリング作業を反映した多様なタスクを含んでいます。このベンチマークは、作業の2つの主要なカテゴリに分かれています:

Independent Engineering Tasks

これらのタスクは、$50の小さなバグ修正から$32,000までの大規模な機能実装まで、複雑さと価値の範囲が異なります。これらのタスクは、経験豊富なソフトウェアエンジニアによって3回検証されたエンドツーエンドテストを使用して採点され、正確性が確保されています。

Managerial Tasks

技術的実装を超えて、SWE-Lancerはモデルが異なる技術実装提案の間で選択を迫られるマネージャタスクを含んでいます。これらの決定は、元の雇用されたエンジニアリングマネージャが行った同じ選択と照らし合わせて評価されます。

モデルのパフォーマンスと評価

OpenAIは、フロンティアモデルは現在、SWE-Lancerベンチマーク内のタスクの大半を解決できないと報告しています。これは、現在のAIの能力とフリーランス作業に必要なプロフェッショナルなソフトウェアエンジニアリングの基準の間に大きなギャップがあることを示しています。

リサーチのアクセシビリティとアップデート

研究コミュニティをサポートするために、OpenAIは統合されたDocker imageとSWE-Lancer Diamondと呼ばれる公開評価スプリットをオープンソース化しました。

2025年7月28日のアップデートで、データセットと結果が2025年7月17日に更新されたことが述べられました。このアップデートでは、実行中のインターネット接続の要件が削除され、これはモデルのパフォーマンスにおける主要な変動源を排除することを意図していました。更新されたデータセットと結果は、OpenAI preparedness GitHub repositoryから利用可能です。

経済的影響のマッピング

総額100万米ドルの実際の支払いが発生するタスクを利用することにより、SWE-LancerはAI駆動のソフトウェアエンジニアリングの経済価値を研究するための設計となっており、モデルのパフォーマンス向上の金銭的指標を提供します。

Sources