facebookresearch/ProgramBench

Can Language Models Rebuild Programs From Scratch?

它解決的問題

ProgramBench 提供了一個基準測試,用於評估 AI 代理是否能從零開始重建完整的原始碼庫。它測試模型在僅有編譯後的二進位檔及其文件的情況下,重建原始二進位檔行為的能力。

如何運作

該專案提供了一組測試和框架,讓 AI 代理嘗試重新建構程式。代理會獲得一個編譯後的二進位檔和文件,並必須產出一個功能與原始程式相符的原始碼庫。

適用對象

此工具專為致力於 AI 代理的研究人員和開發者設計,特別是那些專注於軟體工程和程式碼生成能力的開發者。

特色

  • 從零重建程式的基準測試。
  • 內建排行榜,用以追蹤代理的表現。
  • 已與 mini-swe-agent 基線整合。
  • 可透過 pip 或 uv 安裝為 Python 套件。

相關