harveyai/harvey-labs
A benchmark built to evaluate and improve agent capabilities for supporting legal work.
解決的問題
提供一種標準化的方式,用以評估基於大語言模型(LLM)的智能體處理現實世界法律工作的能力。由於法律任務複雜且要求高精確度,此基準測試幫助開發者在多個法律實務領域中衡量智能體的表現。
工作原理
本項目由兩個主要組件構成:任務資料集(包含具體指示、相關文件和評分標準)以及執行框架。該框架允許開發者將智能體應用於各項任務,並根據預定義的標準自動評估其表現。
適用對象
專為致力於法律領域大語言模型智能體開發的AI研究人員與開發者設計。
主要亮點
- 覆蓋範圍全面,涵蓋24個以上法律實務領域,超過1,600項任務。
- 提供專用執行框架,用於執行與評分智能體。
- 採用全通過制評分體系與LLM裁判進行評估。
- 開源框架支援透過儀表板對比智能體表現。
相關
- 專案
- 專案
- 專案
TIGER-AI-Lab/ClawBenchClawBench 是一個開源基準測試,用於評估 AI 瀏覽器代理在 281 個真實網路任務(如預訂旅行、點餐)上的表現。它提供任務規範、多層追蹤記錄器和 LLM 評判者(deepseek-v4-pro)來評分成功。透過 `pip install clawbench-eval` 安裝,設定你的模型與評判者 API 金鑰,然後在基於 Docker/Podman 的 Chromium 沙箱中執行任務。結果將發布至公開排行榜,完整資料可在 Hugging Face 上取得。
- 專案
harbor-framework/harborHarbor 是一個用於執行與擴展 AI agent 和語言模型基準測試的 Python 框架。可透過 `pip`/`uv` 安裝,它提供了一個 CLI (`harbor run`),讓您可以指定資料集(例如 Terminal‑Bench‑2.0)、agent(Claude‑Code, OpenHands, 等)以及模型,然後在本地或雲端供應商(Daytona, Modal, 等)上以可配置的並行度執行基準測試。它也支援建立自定義基準測試與生成 RL roll‑outs。
- 專案
zli12321/LHTBLong‑Horizon Terminal‑Bench (LHTB) 是一個 46 任務基準,用於衡量 LLM 代理在基於 Docker 的終端中持續工作數百步的能力。它提供了一個修補版的開源 Harbor 框架,增加了「持續到超時」迴圈和沙箱化驗證器隔離,防止代理作弊。結果顯示,當前前線模型僅能解決少數任務,使 LHTB 成為評估自主 AI 代理的高難度、前線級評估套件。