facebookresearch/ProgramBench
Can Language Models Rebuild Programs From Scratch?
它解决了什么问题
ProgramBench 提供了一个基准测试,用于评估 AI 代理是否能够从零开始重建完整的代码库。它测试模型在仅使用编译后的二进制文件及其文档的情况下,重构出与原始二进制文件行为一致的程序架构和实现能力。
它如何工作
该项目提供了一组测试用例和一个框架,供 AI 代理尝试重现程序。代理会获得一个编译后的二进制文件和相关文档,必须生成一个功能与原始程序一致的代码库。
适用对象
此工具专为从事 AI 代理研究和开发的研究人员及开发者设计,特别是关注软件工程和代码生成能力的人员。
主要亮点
- 一个从零开始重建程序的基准测试。
- 包含排行榜以追踪代理性能。
- 与 mini-swe-agent 基线集成。
- 可通过 pip 或 uv 作为 Python 包使用。
相关
- Dispatch
- Dispatch
- 项目
- Dispatch
- 项目