AssetOpsBench: AI 에이전트 벤치마크와 산업 현실 사이의 격차 해소
TL;DR
AssetOpsBench는 일반 AI 벤치마크와 산업 자산 수명주기 관리의 복잡성을 연결하기 위해 설계된 새로운 평가 프레임워크입니다. 고립된 작업 완료에서 벗어나 다중 에이전트 협업, 안전‑중요 실패 분석, 그리고 잡음이 섞인 실제 산업 데이터 하에서의 성능에 초점을 맞춥니다.
산업 규모 평가 데이터셋
AssetOpsBench는 냉각기와 공기 처리 장치와 같은 산업 자산을 관리하도록 지정된 AI 에이전트를 테스트하기 위한 특화된 환경을 제공합니다. 이 벤치마크는 산업 현실을 시뮬레이션하도록 설계된 방대한 데이터셋을 기반으로 합니다:
- 센서 데이터: 230만 개의 센서 텔레메트리 포인트.
- 시나리오: 네 가지 에이전트 역할에 걸쳐 140개 이상의 선별된 시나리오, 전문가 의견을 반영해 150개 이상 개발.
- 작업 지시: 다양한 운영 시나리오를 포괄하는 4,200개의 작업 지시.
- 고장 모드: 53개의 구조화된 고장 모드.
벤치마크 내 작업은 네 가지 주요 카테고리로 구성됩니다: 센서 스트림의 이상 탐지, 고장 모드 추론 및 진단, KPI 예측 및 분석, 그리고 작업 지시의 요약·우선순위 지정.
6차원 정성 평가
이진 성공 지표에 의존하는 대신, AssetOpsBench는 에이전트 시스템을 여섯 가지 정성적 차원에서 평가하여 의사결정이 실행 가능하고 증거에 기반하도록 합니다:
- 작업 완료
- 검색 정확도
- 결과 검증
- 시퀀스 정확성
- 명확성 및 정당화
- 환각 비율
초기 평가 결과에 따르면, 범용 에이전트는 표면 수준의 추론은 잘 수행하지만 다단계 협업, 시간적 의존성, 고장 의미론에서는 어려움을 겪습니다. 이 프레임워크는 단순 성공 신호보다 왜 에이전트가 실패했는지를 이해하는 것을 우선시하며, 이는 고위험 산업 환경에서 필수적입니다.
Trajectory-Level Failure Analysis (TrajFM)
AssetOpsBench는 고장 모드를 1급 평가 신호로 취급합니다. TrajFM이라 불리는 전용 파이프라인을 통해 시스템은 전체 다중‑에이전트 실행 궤적을 분석하고, 세 단계 프로세스로 구체적인 붕괴 지점을 식별합니다:
- 추출: LLM‑가이드 진단 프롬프트가 궤적에서 고장을 추출합니다.
- 클러스터링: 임베딩 기반 클러스터링이 반복되는 고장 패턴을 그룹화합니다.
- 시각화: 분석·시각화가 개발자 반복 작업을 지원합니다.
이 시스템은 고정된 분류 체계에만 의존하지 않고 새로운 고장 패턴을 동적으로 발견하도록 설계되었습니다. 식별된 일반 산업 고장 모드에는 텔레메트리와 작업 지시 간 불일치, 증거가 부족함에도 불구하고 과신, 다중‑에이전트 협업 붕괴(예: 입력 무시) 등이 포함됩니다.
성능 관찰 및 벤치마크
225명의 사용자와 300개 이상의 에이전트를 대상으로 한 커뮤니티 평가 결과, 현재 어떤 모델도 배포 준비에 필요한 85점 기준을 충족하지 못함이 드러났습니다.
모델 성능 비교
| 모델 패밀리 | 최고 계획 점수 | 최고 실행 점수 | 주요 제한 사항 |
|---|---|---|---|
| GPT-4.1 | 68.2 | 72.4 | 복잡한 워크플로에서 환각된 완료 |
| Mistral-Large | 64.7 | 69.1 | 다중‑홉 툴 시퀀스에서 어려움 |
| LLaMA-4 Maverick | 66.0 | 70.8 | 명확화 질문을 놓침 |
| LLaMA-3-70B | 52.3 | 58.9 | 다중‑에이전트 협업에서 붕괴 |
실패 분포
881개의 실행 트레이스를 분석한 결과, 다음과 같은 실패 비율이 나타났습니다:
- 비효율적인 오류 복구: 31.2%
- 과대된 완료 보고: 23.8%
- 포맷 문제: 21.4%
- 처리되지 않은 툴 오류: 10.3%
- 무시된 피드백: 8.0%
- 기타: 5.3%
주요 기술적 발견
- "맞는 듯하지만 틀린" 문제: 에이전트의 23.8%가 오류 복구에 실패했음에도 (31.2%) 작업 완료와 성공을 주장해 산업 운영자에게 큰 위험을 초래합니다.
- 툴 정확도 차별화 요소: 고성능 에이전트는 94% 툴 정확도를 달성한 반면, 저성능 에이전트는 61%에 머뭅니다.
- 다중‑에이전트 복잡성: 단일 에이전트의 작업 정확도가 68%인 반면, 다중‑에이전트 시스템에서는 컨텍스트 손실과 연쇄 실패로 47%로 떨어집니다.
- 지식 통합: 고장 모드 데이터베이스와 유지보수 매뉴얼에 접근하면 성능이 향상되지만, RAG(검색 강화 생성) 지식이 항상 올바르게 활용되지는 않아 보다 구조화된 추론이 필요합니다.
- 모호성 영향: 센서 누락, 로그 충돌, 모호한 설명은 성공률을 34% 감소시켜 명확화 전략의 내재가 필요함을 보여줍니다.