benchflow-ai/benchflow

Research infra for creating RL environments, post-training, and evals.

解決的問題

BenchFlow 提供一個通用框架,用於在任務環境中執行與評估 AI 代理。它將基準測試視為「凍結的環境」,讓開發者能在各種基準測試中,以單一代理或多重代理模式,使用標準化合約對任意 ACP 代理進行測試。

如何運作

BenchFlow 採用由 Rollouts、Scenes、Roles 和 Verifiers 組成的三層模型。它可從外部 Git 倉庫拉取基準測試資料集,或連接到主機環境。該框架支援多種沙箱(如 Docker、Daytona 和 Modal),以隔離代理執行。它還可捕獲並上傳本地編碼代理會話的軌跡(執行日誌),以供評估用途。

適用對象

  • 評估研究人員與論文撰寫者:需要執行標準化評估的人
  • 任務創作者:創建新基準任務與環境的人
  • 代理建構者:希望將其代理整合至 BenchFlow 生態系統的人
  • 基準適配器:希望將第三方基準導入統一格式的人

主要亮點

  • 通用相容性:支援各種代理(如 Claude Code、Codex、Gemini CLI)和模型
  • 彈性執行:支援單代理、多代理(如 編碼者 + 審查者)、多回合模式及逐步揭露
  • 沙箱強化:與 Docker、Daytona 和 Modal 整合,實現安全的代理執行
  • 軌跡捕獲:提供工具用於脫敏並上傳本地代理會話軌跡以供評估
  • 任務撰寫工具:提供 CLI 用於基準任務的腳手架搭建、驗證與遷移

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案