AssetOpsBench:弥合 AI 代理基准与工业现实之间的差距
简要概述
AssetOpsBench 是一个全新的评估框架,旨在弥合通用 AI 基准与工业资产生命周期管理复杂性之间的差距。它将关注点从单一任务完成转向多代理协同、关键安全故障分析以及在嘈杂、真实工业数据下的性能表现。
大规模工业评估数据集
AssetOpsBench 提供了一个专门的环境,用于测试负责管理工业资产(如冷水机组和空气处理单元)的 AI 代理。该基准基于一个庞大的数据集,旨在模拟工业现实:
- 传感器数据: 230 万条传感器遥测点。
- 场景: 超过 140 个精心策划的场景,涵盖四种代理角色,另有 150 多个场景由专家参与开发。
- 工单: 4,200 张工单,覆盖多样的运营场景。
- 故障模式: 53 种结构化故障模式。
基准中的任务涵盖四大类:传感器流的异常检测、故障模式推理与诊断、关键绩效指标(KPI)预测与分析,以及工单的汇总与优先级排序。
六维定性评估
AssetOpsBench 并非依赖二元成功指标,而是从六个定性维度评估代理系统,以确保决策可操作且有据可依:
- 任务完成
- 检索准确性
- 结果验证
- 序列正确性
- 清晰度与论证
- 幻觉率
早期评估表明,通用代理在表层推理上表现良好,但在多步骤协同、时间依赖以及故障语义方面仍显吃力。框架更注重理解 why 代理失败,而非仅仅关注成功信号,这对高风险工业环境至关重要。
轨迹级故障分析(TrajFM)
AssetOpsBench 将故障模式视为一级评估信号。通过名为 TrajFM 的专用流水线,系统分析完整的多代理执行轨迹,使用三阶段流程识别具体的失效点:
- 提取: 由 LLM 引导的诊断提示从轨迹中提取故障。
- 聚类: 基于嵌入的聚类将重复的故障模式归类。
- 可视化: 分析与可视化帮助开发者迭代。
该系统旨在动态发现新故障模式,而非仅依赖固定分类法。常见的工业故障模式包括遥测与工单不匹配、缺少证据却过度自信,以及多代理协同失效(例如输入被忽略)。
性能观察与基准
在 225 位用户和 300 多个代理的社区评估中,发现目前没有模型能够达到部署准备所需的 85 分阈值。
模型性能比较
| 模型系列 | 最佳规划分数 | 最佳执行分数 | 关键限制 |
|---|---|---|---|
| GPT-4.1 | 68.2 | 72.4 | 在复杂工作流中出现幻觉式完成 |
| Mistral-Large | 64.7 | 69.1 | 在多跳工具序列上表现不佳 |
| LLaMA-4 Maverick | 66.0 | 70.8 | 遗漏澄清性问题 |
| LLaMA-3-70B | 52.3 | 58.9 | 在多代理协同下崩溃 |
故障分布
对 881 条执行轨迹的分析显示以下故障分布:
- 无效错误恢复: 31.2%
- 夸大完成度: 23.8%
- 格式问题: 21.4%
- 未处理的工具错误: 10.3%
- 忽视反馈: 8.0%
- 其他: 5.3%
关键技术发现
- “听起来对,但实际上错”问题: 23.8% 的代理在未能从错误中恢复(31.2%)后仍声称任务已完成并输出成功,这对工业运营者构成重大风险。
- 工具准确性作为差异化因素: 高性能代理实现了 94% 的工具准确率,而低性能代理为 61%。
- 多代理复杂性: 由于上下文丢失和级联故障,任务准确率从单代理的 68% 降至多代理系统的 47%。
- 知识整合: 虽然访问故障模式数据库和维护手册能提升性能,但 RAG(检索增强生成)知识并非总被正确使用,表明需要更结构化的推理。
- 歧义影响: 传感器缺失、日志冲突和描述模糊导致成功率下降 34%,凸显嵌入式澄清策略的必要性。