harbor-framework/terminal-bench-science
Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains
해결하는 문제
Terminal-Bench-Science는 복잡하고 실제 과학 연구 워크플로우를 표준화된 방식으로 측정할 수 있는 방법을 제공합니다. 생명과학, 물리학, 지구과학, 수학, 공학 등 다양한 과학 분야에서 요구되는 전문가 수준의 작업과 일반적인 AI 능력 사이의 격차를 메웁니다.
작동 방식
이 프로젝트는 전문가가 큐레이션한 작업들로 구성된 지속적인 벤치마크이며, 터미널 환경에서 객관적으로 검증됩니다. Harbor 프레임워크를 사용하여 에이전트가 이러한 작업에 도전하도록 설정합니다. 커뮤니티 주도의 파이프라인을 통해 분야 전문가들이 작업을 제안하고 구현하며 검토함으로써, 최신 AI 모델에 도전적이고 관련성이 있는 상태를 유지합니다.
대상 사용자
이 벤치마크는 에이전트를 개발하는 AI 연구자와, 실제 업무를 지원할 수 있도록 AI 시스템에 기여하고자 하는 과학 분야 전문가를 위한 것입니다.
주요 특징
- 전문가 큐레이션: 5개의 광범위한 과학 분야의 전문가들이 작업을 작성하고 검토합니다.
- 객관적 검증 가능: 모든 작업은 터미널 환경에서 검증 가능한 결과를 생성합니다.
- 커뮤니티 주도: 작업 제안, 구현, 검토를 투명한 파이프라인으로 운영합니다.
- 오염 방지: 캐니언 문자열을 사용하여 트레이닝 데이터 파이프라인에서 벤치마크 데이터를 감지하고 트레이닝 코퍼스에서 제외할 수 있도록 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트