benchflow-ai/benchflow
Research infra for creating RL environments, post-training, and evals.
解決的問題
BenchFlow 提供一個通用框架,用於在任務環境中執行與評估 AI 代理。它將基準測試視為「凍結的環境」,讓開發者能在各種基準測試中,以單一代理或多重代理模式,使用標準化合約對任意 ACP 代理進行測試。
如何運作
BenchFlow 採用由 Rollouts、Scenes、Roles 和 Verifiers 組成的三層模型。它可從外部 Git 倉庫拉取基準測試資料集,或連接到主機環境。該框架支援多種沙箱(如 Docker、Daytona 和 Modal),以隔離代理執行。它還可捕獲並上傳本地編碼代理會話的軌跡(執行日誌),以供評估用途。
適用對象
- 評估研究人員與論文撰寫者:需要執行標準化評估的人
- 任務創作者:創建新基準任務與環境的人
- 代理建構者:希望將其代理整合至 BenchFlow 生態系統的人
- 基準適配器:希望將第三方基準導入統一格式的人
主要亮點
- 通用相容性:支援各種代理(如 Claude Code、Codex、Gemini CLI)和模型
- 彈性執行:支援單代理、多代理(如 編碼者 + 審查者)、多回合模式及逐步揭露
- 沙箱強化:與 Docker、Daytona 和 Modal 整合,實現安全的代理執行
- 軌跡捕獲:提供工具用於脫敏並上傳本地代理會話軌跡以供評估
- 任務撰寫工具:提供 CLI 用於基準任務的腳手架搭建、驗證與遷移
相關
- 專案
- 專案
- 專案
- 專案
- 專案