claw-eval/claw-eval

Claw-Eval is an evaluation harness for evaluating LLM as agents. All tasks verified by humans.

何を解決するか

Claw-Eval は、基礎モデルの一般的なエージェント能力を評価する信頼性があり再現可能なフレームワークを提供します。エージェント評価における「運の良い実行」の問題に対処するために、複数の試行において一貫した成功を要求することで、モデルのパフォーマンスが偶然によるものではないことを保証します。

仕組み

本プロジェクトは、一般生産性、マルチモーダル認識、複数ターン会話の9つのカテゴリにまたがる300のヒューマン検証済みタスクのデータセットを使用しています。"Pass^3"手法を採用しており、タスクが3回の独立した試行すべてで成功した場合にのみ、合格とみなされます。評価は、完了性、安全性、耐障害性の3つの次元にわたる完全なトラジェクトリーオーディットを通じて行われます。

対象ユーザー

このツールは、自律エージェントや基礎モデルを開発するAI研究者や開発者向けに設計されており、エージェント能力をベンチマークするための厳密で科学的な基盤を必要とする方々に最適です。

特徴

  • Pass^3 メトリクス: 偶発的な結果を排除するために、3回連続で成功する必要がある。
  • 包括的なタスクセット: 一般、マルチモーダル、複数ターンのスプリットにまたがる300のタスク。
  • トラジェクトリーオーディット: 完了性、安全性、耐障害性の観点からエージェントを評価。
  • マルチモーダル対応: ページ生成、動画QA、ドキュメント抽出などのタスクを含む。
  • サンドボックス統合: サンドボックス隔離と完全なトレース追跡をサポートし、評価の透明性を確保。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト