ApodexAI/AgentHarness
Evaluation harness for Apodex-1.0 on public deep-research benchmarks.
解決的問題
AgentHarness 提供了一種標準化的方法來評估 AI 代理在深度研究任務上的效能。它允許開發人員重現 Apodex-1.0 的基準測試結果,並使用一致的 ReAct(推理與行動)設定來測試其他模型。
運作方式
該工具會在一系列公開的深度研究基準測試中執行代理工作流程。它採用基於子程序的執行模型,其中每個問題都在其獨立的隔離程序中處理,以防止 asyncio 飽和,並允許更輕鬆地除錯以及獨立重新執行失敗的樣本。它整合了用於網頁搜尋、網頁抓取和程式碼沙盒的外部工具,以模擬真實世界的研究環境。
適用對象
需要對 LLM 和代理框架的推理與研究能力進行基準測試的 AI 研究人員和開發人員,特別是那些專注於深度研究任務的人員。
亮點
- 隔離執行:在單獨的子程序中執行每個問題,以獲得更好的穩定性和可重現性。
- 廣泛的基準測試支援:支援多種資料集,包括 BrowseComp、DeepSearchQA 和 Humanity's Last Exam。
- 工具整合:內建對網頁搜尋、網頁抓取和程式碼沙盒的支援。
- 標準化設定:實作標準的 ReAct 工作流程,以進行一致的模型評估。
相關
- 專案
- 專案
- 專案
- 專案