harbor-framework/terminal-bench

Measuring and evolving with the frontier of agent work

해결하는 문제

Terminal-Bench는 선도적인 AI 에이전트의 능력을 측정하기 위해 설계된 벤치마크입니다. 시간이 지남에 따라 진화하는 다양한 고난이도의 고품질 작업 세트를 제공하여, 에이전트 개발자가 성과를 추적하고 다양한 에이전트 및 모델의 성능을 비교할 수 있도록 합니다.

작동 방식

Harbor 프레임워크 기반으로 구축되었으며, 사전 환경(예: Modal)에서 실행 가능한 작업 데이터셋으로 구성되어 있습니다. 사용자는 사용할 에이전트와 모델을 지정하고 Harbor CLI 도구를 사용해 벤치마크를 실행할 수 있습니다. 프로젝트는 태그된 릴리스와 공개 랭킹을 유지함으로써 지속적인 벤치마크를 제공합니다.

대상 사용자

복잡한 실제 세계의 터미널 기반 작업을 처리할 수 있는 능력을 평가하고자 하는 선도적인 AI 에이전트 개발자에게 적합합니다.

주요 특징

  • 정체를 방지하기 위해 진화하는 작업을 갖춘 지속적인 벤치마크.
  • 표준화된 실행을 위한 Harbor 프레임워크 통합.
  • 안전하고 안정적인 에이전트 실행을 보장하는 사전 환경 지원.
  • 에이전트 및 모델 성능을 비교할 수 있는 공개 랭킹.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트