rdi-berkeley/agents-last-exam
Agents' Last Exam
해결하는 문제
에이전트의 마지막 시험(ALE)은 장기적인 목표, 경제적 가치가 있는 실제 전문 업무에서의 에이전트 성능을 측정할 수 있는 광범위한 벤치마크의 부재를 해결합니다. 단순한 프롬프트를 넘어서, 에이전트가 다양한 산업 분야에서 복잡한 작업을 실제로 완수할 수 있는지, 검증 가능한 결과를 통해 평가합니다.
작동 방식
ALE는 테스트 대상 시스템(에이전트 허니스)과 현실적인 환경(Windows 또는 Linux 사전) 및 특정 전문 업무를 결합하는 오픈 평가 프레임워크를 제공합니다.
핵심 구성 요소:
- CUA-agents: CLI(명령줄 인터페이스)와 GUI(그래픽 사용자 인터페이스) 기능을 모두 갖춘 에이전트를 평가합니다. 크로스 OS CUA MCP 브리지로 데스크톱 작업(클릭, 입력 등)을 에이전트의 도구로 노출합니다.
- 사전: 실제 머신(가상머신 또는 컨테이너)에서 프로덕션 환경을 재현하여 전문 소프트웨어와 데이터를 포함한 작업을 수행합니다.
- 결정론적 평가: 각 작업은 에이전트가 작업을 완료한 후, 0~1 사이의 점수를 매기기 위해 숨겨진 참조를 사용합니다.
- 실행 루프: 시스템은 사전을 프로비저닝하고 입력을 준비한 후 에이전트를 실행하여 완료하고, 숨겨진 참조를 준비한 후 결과를 평가합니다.
대상 사용자
ALE는 실제 운영 체제 환경에서 다단계 전문 워크플로우를 수행할 수 있는 에이전트의 능력을 벤치마크할 필요가 있는 전선 에이전트 시스템 개발자 및 연구자에게 적합합니다.
주요 특징
- 광범위한 커버리지: 미국 연방 직업 분류 기준에 따라 13개 산업 클러스터에 걸쳐 55개의 하위 도메인을 커버합니다.
- 검증 가능한 결과: 숨겨진 참조와 결정론적 평가자로 유출을 방지하고 객관적인 평가를 보장합니다.
- 다중 플랫폼 지원: Google Cloud, AWS, Alibaba Cloud, QEMU/KVM, Docker를 통해 사전를 지원합니다.
- 완전한 감사: 모든 실행에 대해 일관된 트래잭터리, 원시 로그, 아티팩트를 기록하여 엔드투엔드 재실행이 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트