claw-eval/claw-eval
Claw-Eval is an evaluation harness for evaluating LLM as agents. All tasks verified by humans.
解決的問題
Claw-Eval 提供一個可信且可重現的框架,用於評估基礎模型的通用代理能力。它透過要求在多次試驗中保持一致的成功率,解決代理評估中的「幸運運行」問題,確保模型表現並非出於偶然。
工作原理
本專案使用涵蓋九個類別(包括一般生產力、多模態感知和多輪對話)的300個經人工驗證的任務資料集。採用「Pass^3」方法論,僅在三次獨立試驗中皆成功時,任務才被標記為通過。評估透過三個維度(完成度、安全性、韌性)的完整軌跡審計進行。
適用對象
本工具專為需要嚴謹科學基準來評估其代理能力的AI研究人員與開發者設計,適用於建構自主代理與基礎模型的場景。
主要亮點
- Pass^3 指標:要求連續三次成功執行,以消除偶然結果。
- 全面的任務集:涵蓋一般、多模態與多輪對話的300個任務。
- 軌跡審計:從完成度、安全性與韌性三個維度評估代理表現。
- 多模態支援:包含網頁生成、影片問答與文件萃取等任務。
- 沙箱整合:支援沙箱隔離與完整軌跡追蹤,確保評估過程透明。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案