benchflow-ai/benchflow

Research infra for creating RL environments, post-training, and evals.

何を解決するか

BenchFlow は、タスク環境に対して AI エージェントを実行・評価するためのユニバーサルフレームワークを提供します。ベンチマークを「凍結された環境」として扱い、開発者がさまざまなベンチマークで任意の ACP エージェントを、単一エージェントまたはマルチエージェントのパターンで、標準化された契約に基づいてテストできるようにします。

動作方法

BenchFlow は、Rollouts、Scenes、Roles、Verifiers からなる三層モデルを使用しています。ベンチマークデータセットは外部の Git リポジトリから取得可能で、ホストされた環境にも接続できます。フレームワークは Docker、Daytona、Modal などのさまざまなサンドボックスをサポートし、エージェントの実行を隔離します。また、ローカルのコーディングエージェントセッションからのトレース(実行ログ)をキャプチャし、評価用にアップロードすることも可能です。

対象ユーザー

  • 評価研究者および論文執筆者:標準化された評価を実行する必要がある方
  • タスク作成者:新しいベンチマークタスクや環境を作成する方
  • エージェント開発者:BenchFlow エコシステムにエージェントを統合したい方
  • ベンチマークアダプター:サードパーティベンチマークを統一フォーマットに統合したい方

特徴

  • ユニバーサル互換性:Claude Code、Codex、Gemini CLI などのさまざまなエージェントやモデルに対応
  • 柔軟な実行:単一エージェント、マルチエージェント(例:コーダー + レビュアー)、複数ラウンドのパターンと段階的公開をサポート
  • サンドボックス強化:Docker、Daytona、Modal と統合し、エージェント実行のセキュリティを確保
  • トレースキャプチャ:シークレットをマスクするツールを備え、ローカルエージェントセッションのトレースをアップロードして評価可能
  • タスク作成ツール:ベンチマークタスクのスケルトン作成、検証、移行をサポートする CLI を提供

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト