harveyai/harvey-labs

A benchmark built to evaluate and improve agent capabilities for supporting legal work.

何を解決するか

LLMベースのエージェントが現実世界の法務業務をどれだけうまく処理できるかを標準化された方法で評価できるようにします。法務業務は複雑で高い正確性が求められるため、このベンチマークは開発者がさまざまな法務分野におけるエージェントのパフォーマンスを測定するのに役立ちます。

動作方法

本プロジェクトは、2つの主要なコンポーネントから構成されています:タスクのデータセット(具体的な指示、関連ドキュメント、採点基準を含む)と実行ハッチ(execution harness)。このハッチを使用することで、開発者はエージェントをタスクに対して実行し、定義された基準に基づいて自動的にパフォーマンスを評価できます。

対象ユーザー

法務分野向けにLLMエージェントを開発しているAI研究者および開発者向けに設計されています。

主な特徴

  • 24以上の法務分野にわたる1,600以上のタスクを網羅。
  • エージェントの実行と採点に特化した専用の実行ハッチを提供。
  • すべて合格制の採点システムとLLMジャッジを用いた評価。
  • ダッシュボードを通じてエージェントのパフォーマンスを比較できるオープンソースフレームワーク。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト