ApodexAI/AgentHarness

Evaluation harness for Apodex-1.0 on public deep-research benchmarks.

解決する課題

AgentHarness は、深い研究タスクにおける AI エージェントのパフォーマンスを評価するための標準化された方法を提供します。開発者は、Apodex-1.0 のベンチマーク結果を再現し、一貫した ReAct(推論と行動)セットアップを使用して他のモデルをテストすることができます。

仕組み

このハーネスは、一連の公開された深い研究ベンチマーク全体でエージェントパイプラインを実行します。各質問が独自の隔離されたプロセスで処理されるサブプロセスベースの実行モデルを採用しており、asyncio の飽和を防ぎ、デバッグを容易にし、失敗したサンプルの独立した再実行を可能にします。現実世界の研究環境をシミュレートするために、Web 検索、Web フェッチ、コードサンドボックス用の外部ツールと統合されています。

対象者

LLM とエージェントフレームワークの推論および研究能力をベンチマークする必要がある AI 研究者および開発者、特に深い研究タスクに焦点を当てている人向けです。

ハイライト

  • 隔離された実行: より高い安定性と再現性を実現するために、各質問を個別のサブプロセスで実行します。
  • 幅広いベンチマークサポート: BrowseComp、DeepSearchQA、Humanity's Last Exam などの複数のデータセットをサポートしています。
  • ツール統合: Web 検索、Web フェッチ、コードサンドボックスのサポートを組み込んでいます。
  • 標準化されたセットアップ: 一貫したモデル評価のために標準的な ReAct パイプラインを実装しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト