harveyai/harvey-labs

A benchmark built to evaluate and improve agent capabilities for supporting legal work.

解决的问题

提供了一种标准化的方法,用于评估基于大语言模型(LLM)的智能体处理现实世界法律工作的能力。由于法律任务复杂且要求高精度,该基准测试帮助开发者在多个法律实务领域中衡量智能体的性能表现。

工作原理

该项目由两个主要组件构成:任务数据集(包含具体指令、相关文档和评分标准)以及执行框架。该框架允许开发者将智能体应用于各项任务,并根据预定义的评分标准自动评估其表现。

适用对象

专为致力于法律领域大语言模型智能体开发的AI研究人员和开发者设计。

主要亮点

  • 覆盖范围全面,涵盖24个以上法律实务领域,超过1,600项任务。
  • 提供专用执行框架,用于运行和评分智能体。
  • 采用全通过制评分体系与LLM裁判进行评估。
  • 开源框架支持通过仪表盘对比智能体性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目