harbor-framework/terminal-bench
Measuring and evolving with the frontier of agent work
해결하는 문제
Terminal-Bench는 선도적인 AI 에이전트의 능력을 측정하기 위해 설계된 벤치마크입니다. 시간이 지남에 따라 진화하는 다양한 고난이도의 고품질 작업 세트를 제공하여, 에이전트 개발자가 성과를 추적하고 다양한 에이전트 및 모델의 성능을 비교할 수 있도록 합니다.
작동 방식
Harbor 프레임워크 기반으로 구축되었으며, 사전 환경(예: Modal)에서 실행 가능한 작업 데이터셋으로 구성되어 있습니다. 사용자는 사용할 에이전트와 모델을 지정하고 Harbor CLI 도구를 사용해 벤치마크를 실행할 수 있습니다. 프로젝트는 태그된 릴리스와 공개 랭킹을 유지함으로써 지속적인 벤치마크를 제공합니다.
대상 사용자
복잡한 실제 세계의 터미널 기반 작업을 처리할 수 있는 능력을 평가하고자 하는 선도적인 AI 에이전트 개발자에게 적합합니다.
주요 특징
- 정체를 방지하기 위해 진화하는 작업을 갖춘 지속적인 벤치마크.
- 표준화된 실행을 위한 Harbor 프레임워크 통합.
- 안전하고 안정적인 에이전트 실행을 보장하는 사전 환경 지원.
- 에이전트 및 모델 성능을 비교할 수 있는 공개 랭킹.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트