ApodexAI/AgentHarness

Evaluation harness for Apodex-1.0 on public deep-research benchmarks.

해결하는 문제

AgentHarness는 심층 연구 작업에서 AI 에이전트의 성능을 평가하는 표준화된 방법을 제공합니다. 개발자는 Apodex-1.0의 벤치마크 결과를 재현하고 일관된 ReAct(추론 및 행동) 설정을 사용하여 다른 모델을 테스트할 수 있습니다.

작동 방식

이 하네스는 공개된 일련의 심층 연구 벤치마크에서 에이전트 파이프라인을 실행합니다. 각 질문이 자체 격리된 프로세스에서 처리되는 서브프로세스 기반 실행 모델을 사용하여 asyncio 포화를 방지하고 디버깅을 더 쉽게 하며 실패한 샘플의 독립적인 재실행을 허용합니다. 실제 연구 환경을 시뮬레이션하기 위해 웹 검색, 웹 페칭 및 코드 샌드박싱을 위한 외부 도구와 통합됩니다.

대상 독자

LLM 및 에이전트 프레임워크의 추론 및 연구 능력을 벤치마크해야 하는 AI 연구원 및 개발자, 특히 심층 연구 작업에 중점을 두는 사람들을 위한 것입니다.

하이라이트

  • 격리된 실행: 더 나은 안정성과 재현성을 위해 각 질문을 별도의 서브프로세스에서 실행합니다.
  • 폭넓은 벤치마크 지원: BrowseComp, DeepSearchQA 및 Humanity's Last Exam을 포함한 여러 데이터셋을 지원합니다.
  • 도구 통합: 웹 검색, 웹 페치 및 코드 샌드박스에 대한 기본 제공 지원.
  • 표준화된 설정: 일관된 모델 평가를 위한 표준 ReAct 파이프라인을 구현합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트