facebookresearch/ProgramBench

Can Language Models Rebuild Programs From Scratch?

它解决了什么问题

ProgramBench 提供了一个基准测试,用于评估 AI 代理是否能够从零开始重建完整的代码库。它测试模型在仅使用编译后的二进制文件及其文档的情况下,重构出与原始二进制文件行为一致的程序架构和实现能力。

它如何工作

该项目提供了一组测试用例和一个框架,供 AI 代理尝试重现程序。代理会获得一个编译后的二进制文件和相关文档,必须生成一个功能与原始程序一致的代码库。

适用对象

此工具专为从事 AI 代理研究和开发的研究人员及开发者设计,特别是关注软件工程和代码生成能力的人员。

主要亮点

  • 一个从零开始重建程序的基准测试。
  • 包含排行榜以追踪代理性能。
  • 与 mini-swe-agent 基线集成。
  • 可通过 pip 或 uv 作为 Python 包使用。

相关