claw-eval/claw-eval
Claw-Eval is an evaluation harness for evaluating LLM as agents. All tasks verified by humans.
何を解決するか
Claw-Eval は、基礎モデルの一般的なエージェント能力を評価する信頼性があり再現可能なフレームワークを提供します。エージェント評価における「運の良い実行」の問題に対処するために、複数の試行において一貫した成功を要求することで、モデルのパフォーマンスが偶然によるものではないことを保証します。
仕組み
本プロジェクトは、一般生産性、マルチモーダル認識、複数ターン会話の9つのカテゴリにまたがる300のヒューマン検証済みタスクのデータセットを使用しています。"Pass^3"手法を採用しており、タスクが3回の独立した試行すべてで成功した場合にのみ、合格とみなされます。評価は、完了性、安全性、耐障害性の3つの次元にわたる完全なトラジェクトリーオーディットを通じて行われます。
対象ユーザー
このツールは、自律エージェントや基礎モデルを開発するAI研究者や開発者向けに設計されており、エージェント能力をベンチマークするための厳密で科学的な基盤を必要とする方々に最適です。
特徴
- Pass^3 メトリクス: 偶発的な結果を排除するために、3回連続で成功する必要がある。
- 包括的なタスクセット: 一般、マルチモーダル、複数ターンのスプリットにまたがる300のタスク。
- トラジェクトリーオーディット: 完了性、安全性、耐障害性の観点からエージェントを評価。
- マルチモーダル対応: ページ生成、動画QA、ドキュメント抽出などのタスクを含む。
- サンドボックス統合: サンドボックス隔離と完全なトレース追跡をサポートし、評価の透明性を確保。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト