SWE-bench/SWE-bench

SWE-bench: Can Language Models Resolve Real-world Github Issues?

解決的問題

SWE-bench 是為了評估大規模語言模型(LLMs)解決真實世界軟體工程問題的能力而設計的。它超越了簡單的程式碼片段,測試 AI 是否能處理完整的程式碼庫,並為實際的 GitHub 問題生成可運作的修補程式。

作法

此基準提供一組真實世界的 GitHub 問題及其對應的程式碼庫。模型會收到程式碼庫與問題描述,必須產生一個程式碼修補(diff)來解決問題。系統透過 Docker 實作完全容器化的評估環境,執行並驗證產生的修補是否能以可重現的方式真正修復問題。

適用對象

主要針對開發軟體工程代理或專注於程式撰寫的 LLM 的 AI 研究人員與開發者,他們需要一種標準化的方式來衡量模型解決複雜真實世界軟體缺陷的能力。

主要亮點

  • 真實世界資料:使用實際的 GitHub 問題與程式碼庫,而非合成任務。
  • 容器化評估:使用 Docker 確保評估過程可重現且環境隔離。
  • 多樣化資料集:包含 SWE-bench Verified(經人工確認可解決的問題)、Multimodal(視覺軟體領域)、Multilingual 等專用版本。
  • 雲端整合:支援透過 Modal 和 sb-cli 進行雲端評估。
  • 訓練支援:提供預處理的資料集與用於現有模型訓練與推論的工具。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案