harveyai/harvey-labs

A benchmark built to evaluate and improve agent capabilities for supporting legal work.

解決的問題

提供一種標準化的方式,用以評估基於大語言模型(LLM)的智能體處理現實世界法律工作的能力。由於法律任務複雜且要求高精確度,此基準測試幫助開發者在多個法律實務領域中衡量智能體的表現。

工作原理

本項目由兩個主要組件構成:任務資料集(包含具體指示、相關文件和評分標準)以及執行框架。該框架允許開發者將智能體應用於各項任務,並根據預定義的標準自動評估其表現。

適用對象

專為致力於法律領域大語言模型智能體開發的AI研究人員與開發者設計。

主要亮點

  • 覆蓋範圍全面,涵蓋24個以上法律實務領域,超過1,600項任務。
  • 提供專用執行框架,用於執行與評分智能體。
  • 採用全通過制評分體系與LLM裁判進行評估。
  • 開源框架支援透過儀表板對比智能體表現。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案