claw-eval/claw-eval
Claw-Eval is an evaluation harness for evaluating LLM as agents. All tasks verified by humans.
解决的问题
Claw-Eval 提供了一个可信且可复现的框架,用于评估基础模型的通用代理能力。它通过要求在多次试验中保持一致的成功率,解决了代理评估中的“幸运运行”问题,确保模型性能并非偶然所致。
工作原理
该项目使用涵盖九个类别(包括通用生产力、多模态感知和多轮对话)的300个经人工验证的任务数据集。采用“Pass^3”方法论,只有在三次独立试验中均成功时,任务才被标记为通过。评估通过三个维度(完成度、安全性、鲁棒性)的完整轨迹审计进行。
适用人群
本工具专为需要严谨科学基准来评估其代理能力的AI研究人员和开发者设计,适用于构建自主代理和基础模型的场景。
主要亮点
- Pass^3 指标:要求连续三次成功运行,以消除偶然结果。
- 全面的任务集:涵盖通用、多模态和多轮对话的300个任务。
- 轨迹审计:从完成度、安全性和鲁棒性三个维度评估代理表现。
- 多模态支持:包含网页生成、视频问答和文档提取等任务。
- 沙箱集成:支持沙箱隔离和完整轨迹追踪,确保评估过程透明。
相关
- 项目
- 项目
- 项目
- Dispatch
- 项目