harveyai/harvey-labs
A benchmark built to evaluate and improve agent capabilities for supporting legal work.
何を解決するか
LLMベースのエージェントが現実世界の法務業務をどれだけうまく処理できるかを標準化された方法で評価できるようにします。法務業務は複雑で高い正確性が求められるため、このベンチマークは開発者がさまざまな法務分野におけるエージェントのパフォーマンスを測定するのに役立ちます。
動作方法
本プロジェクトは、2つの主要なコンポーネントから構成されています:タスクのデータセット(具体的な指示、関連ドキュメント、採点基準を含む)と実行ハッチ(execution harness)。このハッチを使用することで、開発者はエージェントをタスクに対して実行し、定義された基準に基づいて自動的にパフォーマンスを評価できます。
対象ユーザー
法務分野向けにLLMエージェントを開発しているAI研究者および開発者向けに設計されています。
主な特徴
- 24以上の法務分野にわたる1,600以上のタスクを網羅。
- エージェントの実行と採点に特化した専用の実行ハッチを提供。
- すべて合格制の採点システムとLLMジャッジを用いた評価。
- ダッシュボードを通じてエージェントのパフォーマンスを比較できるオープンソースフレームワーク。
関連
- プロジェクト
InternLM/WildClawBenchブラウザやbash terminalなどのツールを使用して、ライブ環境で複雑な現実世界のタスクを遂行するAIエージェントの能力をテストする、エンドツーエンドのエージェント・ベンチマーク。
- プロジェクト
- プロジェクト
TIGER-AI-Lab/ClawBenchClawBenchは、281の実世界のウェブタスク(例:旅行の予約、食事の注文)を評価するオープンソースのベンチマークです。タスク仕様、マルチレイヤートレースレコーダー、およびLLMジャッジ(deepseek-v4-pro)を提供し、成功をスコアリングします。`pip install clawbench-eval` でインストールし、モデルとジャッジのAPIキーを設定してから、Docker/PodmanベースのChromiumハーネスでタスクを実行します。結果はパブリックリーダーボードに投稿され、全データはHugging Faceで利用可能です。
- プロジェクト
harbor-framework/harborHarborは、AIエージェントと大規模言語モデル(LLM)のベンチマークを実行・拡張するためのPythonフレームワークです。`pip`/`uv`経由でインストール可能で、CLI (`harbor run`) を使用して、データセット (e.g., Terminal‑Bench‑2.0)、エージェント (Claude‑Code, OpenHands, 等)、モデルを指定し、ローカルまたはクラウドプロバイダー (Daytona, Modal, 等) 上で並列実行を可能にします。また、カスタムベンチマークの作成やRL roll‑outsの生成もサポートしています。
- プロジェクト
zli12321/LHTBLong‑Horizon Terminal‑Bench (LHTB) は、Dockerベースのターミナル内で数百ステップにわたり作業を継続できるように、LLMエージェントの能力を測定する46タスクのベンチマークです。オープンソースのHarborハーネスのパッチ版を提供し、「タイムアウトまで継続」ループとサンドボックス化された検証器の隔離を追加することで、エージェントによる不正行為を防ぎます。結果は、現在のフロンティアモデルですらタスクの少数しか解けないことを示しており、自律的AIエージェントのための困難で先端的な評価ツールであることがわかります。