AssetOpsBench:弥合 AI 代理基准与工业现实之间的差距

简要概述

AssetOpsBench 是一个全新的评估框架,旨在弥合通用 AI 基准与工业资产生命周期管理复杂性之间的差距。它将关注点从单一任务完成转向多代理协同、关键安全故障分析以及在嘈杂、真实工业数据下的性能表现。

大规模工业评估数据集

AssetOpsBench 提供了一个专门的环境,用于测试负责管理工业资产(如冷水机组和空气处理单元)的 AI 代理。该基准基于一个庞大的数据集,旨在模拟工业现实:

  • 传感器数据: 230 万条传感器遥测点。
  • 场景: 超过 140 个精心策划的场景,涵盖四种代理角色,另有 150 多个场景由专家参与开发。
  • 工单: 4,200 张工单,覆盖多样的运营场景。
  • 故障模式: 53 种结构化故障模式。

基准中的任务涵盖四大类:传感器流的异常检测、故障模式推理与诊断、关键绩效指标(KPI)预测与分析,以及工单的汇总与优先级排序。

六维定性评估

AssetOpsBench 并非依赖二元成功指标,而是从六个定性维度评估代理系统,以确保决策可操作且有据可依:

  1. 任务完成
  2. 检索准确性
  3. 结果验证
  4. 序列正确性
  5. 清晰度与论证
  6. 幻觉率

早期评估表明,通用代理在表层推理上表现良好,但在多步骤协同、时间依赖以及故障语义方面仍显吃力。框架更注重理解 why 代理失败,而非仅仅关注成功信号,这对高风险工业环境至关重要。

轨迹级故障分析(TrajFM)

AssetOpsBench 将故障模式视为一级评估信号。通过名为 TrajFM 的专用流水线,系统分析完整的多代理执行轨迹,使用三阶段流程识别具体的失效点:

  1. 提取: 由 LLM 引导的诊断提示从轨迹中提取故障。
  2. 聚类: 基于嵌入的聚类将重复的故障模式归类。
  3. 可视化: 分析与可视化帮助开发者迭代。

该系统旨在动态发现新故障模式,而非仅依赖固定分类法。常见的工业故障模式包括遥测与工单不匹配、缺少证据却过度自信,以及多代理协同失效(例如输入被忽略)。

性能观察与基准

在 225 位用户和 300 多个代理的社区评估中,发现目前没有模型能够达到部署准备所需的 85 分阈值。

模型性能比较

模型系列 最佳规划分数 最佳执行分数 关键限制
GPT-4.1 68.2 72.4 在复杂工作流中出现幻觉式完成
Mistral-Large 64.7 69.1 在多跳工具序列上表现不佳
LLaMA-4 Maverick 66.0 70.8 遗漏澄清性问题
LLaMA-3-70B 52.3 58.9 在多代理协同下崩溃

故障分布

对 881 条执行轨迹的分析显示以下故障分布:

  • 无效错误恢复: 31.2%
  • 夸大完成度: 23.8%
  • 格式问题: 21.4%
  • 未处理的工具错误: 10.3%
  • 忽视反馈: 8.0%
  • 其他: 5.3%

关键技术发现

  • “听起来对,但实际上错”问题: 23.8% 的代理在未能从错误中恢复(31.2%)后仍声称任务已完成并输出成功,这对工业运营者构成重大风险。
  • 工具准确性作为差异化因素: 高性能代理实现了 94% 的工具准确率,而低性能代理为 61%。
  • 多代理复杂性: 由于上下文丢失和级联故障,任务准确率从单代理的 68% 降至多代理系统的 47%。
  • 知识整合: 虽然访问故障模式数据库和维护手册能提升性能,但 RAG(检索增强生成)知识并非总被正确使用,表明需要更结构化的推理。
  • 歧义影响: 传感器缺失、日志冲突和描述模糊导致成功率下降 34%,凸显嵌入式澄清策略的必要性。

Sources