claw-eval/claw-eval

Claw-Eval is an evaluation harness for evaluating LLM as agents. All tasks verified by humans.

解决的问题

Claw-Eval 提供了一个可信且可复现的框架,用于评估基础模型的通用代理能力。它通过要求在多次试验中保持一致的成功率,解决了代理评估中的“幸运运行”问题,确保模型性能并非偶然所致。

工作原理

该项目使用涵盖九个类别(包括通用生产力、多模态感知和多轮对话)的300个经人工验证的任务数据集。采用“Pass^3”方法论,只有在三次独立试验中均成功时,任务才被标记为通过。评估通过三个维度(完成度、安全性、鲁棒性)的完整轨迹审计进行。

适用人群

本工具专为需要严谨科学基准来评估其代理能力的AI研究人员和开发者设计,适用于构建自主代理和基础模型的场景。

主要亮点

  • Pass^3 指标:要求连续三次成功运行,以消除偶然结果。
  • 全面的任务集:涵盖通用、多模态和多轮对话的300个任务。
  • 轨迹审计:从完成度、安全性和鲁棒性三个维度评估代理表现。
  • 多模态支持:包含网页生成、视频问答和文档提取等任务。
  • 沙箱集成:支持沙箱隔离和完整轨迹追踪,确保评估过程透明。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目