suyoumo/ClawProBench

ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.

解决的问题

ClawProBench 是一个专为评估 OpenClaw 运行时内运行的 AI 代理能力而设计的基准测试框架。它解决了对透明、实时执行评估与决定性评分的需求,摆脱了静态评估,转而测试代理在真实运行时环境中的实际表现。

工作原理

该系统使用一组基准配置文件(如 coreintelligencenative)将 AI 代理置于各种场景中运行。支持多轮测试(例如 3 次尝试),以衡量稳定性与成功率。该框架通过 OpenClaw CLI 管理代理执行,追踪执行轨迹,并应用决定性评分逻辑——包括自定义检查器——以判断任务是否成功完成。

适用人群

适用于需要严格测试和评估其模型在实时运行时代理任务中表现的 AI 研究人员、模型开发者以及使用代理框架的开发者。

主要亮点

  • 实时执行优先:直接在 OpenClaw 运行时内评估模型,而非使用静态数据集。
  • 全面的场景集:涵盖 6 个领域共 102 个活跃场景,另有额外的孵化中场景。
  • 决定性评分:使用结构化报告和自定义检查器,确保结果的一致性和可复现性。
  • 高级指标:实现 FinalScore,对稳定重复成功(pass^3)和整体质量进行加权。
  • 容错执行:支持检查点恢复和仅重试执行失败项,以优化评估成本。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目