benchflow-ai/benchflow
Research infra for creating RL environments, post-training, and evals.
何を解決するか
BenchFlow は、タスク環境に対して AI エージェントを実行・評価するためのユニバーサルフレームワークを提供します。ベンチマークを「凍結された環境」として扱い、開発者がさまざまなベンチマークで任意の ACP エージェントを、単一エージェントまたはマルチエージェントのパターンで、標準化された契約に基づいてテストできるようにします。
動作方法
BenchFlow は、Rollouts、Scenes、Roles、Verifiers からなる三層モデルを使用しています。ベンチマークデータセットは外部の Git リポジトリから取得可能で、ホストされた環境にも接続できます。フレームワークは Docker、Daytona、Modal などのさまざまなサンドボックスをサポートし、エージェントの実行を隔離します。また、ローカルのコーディングエージェントセッションからのトレース(実行ログ)をキャプチャし、評価用にアップロードすることも可能です。
対象ユーザー
- 評価研究者および論文執筆者:標準化された評価を実行する必要がある方
- タスク作成者:新しいベンチマークタスクや環境を作成する方
- エージェント開発者:BenchFlow エコシステムにエージェントを統合したい方
- ベンチマークアダプター:サードパーティベンチマークを統一フォーマットに統合したい方
特徴
- ユニバーサル互換性:Claude Code、Codex、Gemini CLI などのさまざまなエージェントやモデルに対応
- 柔軟な実行:単一エージェント、マルチエージェント(例:コーダー + レビュアー)、複数ラウンドのパターンと段階的公開をサポート
- サンドボックス強化:Docker、Daytona、Modal と統合し、エージェント実行のセキュリティを確保
- トレースキャプチャ:シークレットをマスクするツールを備え、ローカルエージェントセッションのトレースをアップロードして評価可能
- タスク作成ツール:ベンチマークタスクのスケルトン作成、検証、移行をサポートする CLI を提供
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト