ApodexAI/AgentHarness

Evaluation harness for Apodex-1.0 on public deep-research benchmarks.

解決的問題

AgentHarness 提供了一種標準化的方法來評估 AI 代理在深度研究任務上的效能。它允許開發人員重現 Apodex-1.0 的基準測試結果,並使用一致的 ReAct(推理與行動)設定來測試其他模型。

運作方式

該工具會在一系列公開的深度研究基準測試中執行代理工作流程。它採用基於子程序的執行模型,其中每個問題都在其獨立的隔離程序中處理,以防止 asyncio 飽和,並允許更輕鬆地除錯以及獨立重新執行失敗的樣本。它整合了用於網頁搜尋、網頁抓取和程式碼沙盒的外部工具,以模擬真實世界的研究環境。

適用對象

需要對 LLM 和代理框架的推理與研究能力進行基準測試的 AI 研究人員和開發人員,特別是那些專注於深度研究任務的人員。

亮點

  • 隔離執行:在單獨的子程序中執行每個問題,以獲得更好的穩定性和可重現性。
  • 廣泛的基準測試支援:支援多種資料集,包括 BrowseComp、DeepSearchQA 和 Humanity's Last Exam。
  • 工具整合:內建對網頁搜尋、網頁抓取和程式碼沙盒的支援。
  • 標準化設定:實作標準的 ReAct 工作流程,以進行一致的模型評估。

相關

  • 專案
  • 專案
  • 專案
  • 專案