suyoumo/ClawProBench
ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.
What it solves
ClawProBench 是一个基准测试框架,旨在评估在 OpenClaw 运行时中运行的 AI 代理的能力。它解决了需要透明、实时执行基准测试的问题,使用确定性评分来衡量模型在真实任务上的表现,而不是仅依赖静态数据集。
How it works
系统作为实时优先的基准测试框架运行,会在各种场景下执行任务。它使用 CLI (run.py) 来管理基准测试流程,包括清单检查、干跑以及完整执行。该框架会桥接至 OpenClaw 运行时以运行代理,然后应用位于 custom_checks 中的场景特定评分逻辑来判断成功与否。它支持多次试验运行(例如 3 次尝试)以计算稳定性指标,如 pass^3 与 pass@3。
Who it’s for
此工具适用于需要评估代理能力并确保其模型能够在 OpenClaw 生态系统中可靠执行任务的 AI 研究者和模型开发者。
Highlights
- Live-First Execution: 在实际的 OpenClaw 运行时中评估模型,而不是使用模拟环境。
- Deterministic Grading: 使用结构化报告和自定义检查逻辑,确保评分一致。
- Comprehensive Profiles: 提供多种基准测试配置 (
core,intelligence,coverage,native,full),在快速排名套件和扩展能力测试之间取得平衡。 - Robust Execution: 支持检查点恢复、跨环境恢复,以及重新排队执行失败的任务。
- Detailed Metrics: 计算
FinalScore,对稳定的重复成功给予更高权重,而非一次性成功。