ApodexAI/AgentHarness
Evaluation harness for Apodex-1.0 on public deep-research benchmarks.
解决的问题
AgentHarness 提供了一种标准化的方法来评估 AI 代理在深度研究任务上的性能。它允许开发人员重现 Apodex-1.0 的基准测试结果,并使用一致的 ReAct(推理与行动)设置来测试其他模型。
工作原理
该工具会在一套公开的深度研究基准测试中运行代理流水线。它采用基于子进程的执行模型,其中每个问题都在其独立的隔离进程中处理,以防止 asyncio 饱和,并允许更轻松地调试以及独立重新运行失败的样本。它集成了用于网络搜索、网络抓取和代码沙盒的外部工具,以模拟真实世界的研究环境。
适用人群
需要对 LLM 和代理框架的推理与研究能力进行基准测试的 AI 研究人员和开发人员,特别是那些专注于深度研究任务的人员。
亮点
- 隔离执行:在单独的子进程中运行每个问题,以获得更好的稳定性和可重现性。
- 广泛的基准测试支持:支持多种数据集,包括 BrowseComp、DeepSearchQA 和 Humanity's Last Exam。
- 工具集成:内置对网络搜索、网络抓取和代码沙盒的支持。
- 标准化设置:实现标准的 ReAct 流水线,以进行一致的模型评估。
相关
- 项目
- 项目
- 项目
- 项目