facebookresearch/ProgramBench

Can Language Models Rebuild Programs From Scratch?

What it solves

ProgramBenchは、AIエージェントが完全なコードベースをゼロから再構築できるかどうかを評価するためのベンチマークを提供します。これは、コンパイル済みのバイナリとそのドキュメントのみを使用して、元のバイナリの動作を再現するプログラムを設計・実装するモデルの能力をテストします。

How it works

このプロジェクトは、AIエージェントがプログラムを再作成しようとするための一連のテストとフレームワークを提供します。エージェントにはコンパイル済みのバイナリとドキュメントが与えられ、元のプログラムの機能と一致するコードベースを生成しなければなりません。

Who it’s for

このツールは、AIエージェント、特にソフトウェアエンジニアリングとコード生成能力に焦点を当てている研究者や開発者向けに設計されています。

Highlights

  • プログラムをゼロから再構築するためのベンチマーク。
  • エージェントのパフォーマンスを追跡するためのリーダーボードを含む。
  • mini-swe-agent ベースラインと統合されている。
  • pip または uv を介して Python パッケージとして利用可能。

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch
  • プロジェクト