benchflow-ai/benchflow

Research infra for creating RL environments, post-training, and evals.

解决的问题

BenchFlow 提供了一个通用框架,用于在任务环境中运行和评估 AI 代理。它将基准测试视为「冻结的环境」,使开发者能够在各种基准测试中,以单代理或多代理模式,使用标准化的合约对任意 ACP 代理进行测试。

如何工作

BenchFlow 采用由 Rollouts、Scenes、Roles 和 Verifiers 组成的三层模型。它可以从外部 Git 仓库拉取基准测试数据集,或连接到托管环境。该框架支持多种沙箱(如 Docker、Daytona 和 Modal),以隔离代理执行。它还可以捕获并上传本地编码代理会话的轨迹(执行日志),用于评估目的。

适用人群

  • 评估研究人员和论文撰写者:需要运行标准化评估的人
  • 任务创建者:创建新基准任务和环境的人
  • 代理构建者:希望将其代理集成到 BenchFlow 生态系统中的人
  • 基准适配器:希望将第三方基准引入统一格式的人

主要亮点

  • 通用兼容性:支持各种代理(如 Claude Code、Codex、Gemini CLI)和模型
  • 灵活执行:支持单代理、多代理(如 编码者 + 审查者)、多轮模式及渐进式披露
  • 沙箱强化:与 Docker、Daytona 和 Modal 集成,实现安全的代理执行
  • 轨迹捕获:提供工具用于脱敏并上传本地代理会话轨迹以供评估
  • 任务编写工具:提供 CLI 用于基准任务的脚手架搭建、验证和迁移

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目