harveyai/harvey-labs
A benchmark built to evaluate and improve agent capabilities for supporting legal work.
解决的问题
提供了一种标准化的方法,用于评估基于大语言模型(LLM)的智能体处理现实世界法律工作的能力。由于法律任务复杂且要求高精度,该基准测试帮助开发者在多个法律实务领域中衡量智能体的性能表现。
工作原理
该项目由两个主要组件构成:任务数据集(包含具体指令、相关文档和评分标准)以及执行框架。该框架允许开发者将智能体应用于各项任务,并根据预定义的评分标准自动评估其表现。
适用对象
专为致力于法律领域大语言模型智能体开发的AI研究人员和开发者设计。
主要亮点
- 覆盖范围全面,涵盖24个以上法律实务领域,超过1,600项任务。
- 提供专用执行框架,用于运行和评分智能体。
- 采用全通过制评分体系与LLM裁判进行评估。
- 开源框架支持通过仪表盘对比智能体性能。
相关
- 项目
- 项目
- 项目
TIGER-AI-Lab/ClawBenchClawBench 是一个开源基准测试,用于评估 AI 浏览器代理在 281 个真实网络任务(如预订旅行、点餐)上的表现。它提供任务规范、多层追踪记录器和 LLM 评判者(deepseek-v4-pro)来评分成功。通过 `pip install clawbench-eval` 安装,配置你的模型和评判者 API 密钥,然后在基于 Docker/Podman 的 Chromium 沙箱中运行任务。结果将发布到公开排行榜,完整数据可在 Hugging Face 上获取。
- 项目
harbor-framework/harborHarbor 是一个用于执行与扩展 AI agent 和语言模型基准测试的 Python 框架。可通过 `pip`/`uv` 安装,它提供了一个 CLI (`harbor run`),让您可以指定数据集 (例如 Terminal‑Bench‑2.0), agent (Claude‑Code, OpenHands, 等), 以及模型, 然后在本地或云端供应商 (Daytona, Modal, 等) 上以可配置的并行度执行基准测试。它也支持创建自定义基准测试与生成 RL roll‑outs。
- 项目
zli12321/LHTBLong‑Horizon Terminal‑Bench (LHTB) 是一个 46 任务基准,用于衡量 LLM 代理在基于 Docker 的终端中持续工作数百步的能力。它提供了一个修补版的开源 Harbor 框架,增加了“持续到超时”循环和沙箱化验证器隔离,防止代理作弊。结果显示,当前前沿模型仅能解决少数任务,使 LHTB 成为评估自主 AI 代理的高难度、前沿级评测套件。