AssetOpsBench:彌合 AI 代理基準與工業現實之間的差距

TL;DR

AssetOpsBench 是一個新型評估框架,旨在彌合通用 AI 基準與工業資產生命週期管理之間的複雜性差距。它將焦點從單一任務完成轉向多代理協調、安全關鍵的失效分析,以及在噪聲龐雜的真實工業數據下的表現。

工業規模評估資料集

AssetOpsBench 提供一個專門環境,用於測試負責管理工業資產(如冷水機與空氣處理裝置)的 AI 代理。此基準以一個龐大的資料集為基礎,旨在模擬工業現實:

  • 感測器資料: 230 萬筆感測遙測點。
  • 情境: 超過 140 個精選情境,涵蓋四種代理角色,另有 150 多個情境由專家參與開發。
  • 工單: 4,200 張工單,涵蓋多樣的運營情境。
  • 失效模式: 53 種結構化失效模式。

基準內的任務涵蓋四大類別:感測器串流的異常偵測、失效模式推理與診斷、關鍵績效指標(KPI)預測與分析,以及工單的摘要與優先排序。

六維質性評估

AssetOpsBench 不依賴二元成功指標,而是從六個質性維度評估代理系統,以確保決策可執行且有據可依:

  1. 任務完成
  2. 檢索準確度
  3. 結果驗證
  4. 序列正確性
  5. 清晰度與論證
  6. 幻覺率

早期評估顯示,雖然通用代理在表層推理上表現良好,但在多步協調、時間依賴性以及失效語義上仍有困難。框架優先關注了解代理失敗的原因,而非僅僅的成功訊號,這對高風險的工業環境至關重要。

軌跡層級失效分析(TrajFM)

AssetOpsBench 將失效模式視為一級評估訊號。透過名為 TrajFM 的專屬管線,系統分析完整的多代理執行軌跡,藉由三階段流程辨識具體的失效點:

  1. 抽取: 由 LLM 引導的診斷提示從軌跡中抽取失效。
  2. 聚類: 基於嵌入的聚類將重複的失效模式分組。
  3. 可視化: 分析與可視化支援開發者迭代。

此系統旨在動態發掘新失效模式,而非僅依賴固定分類。常見的工業失效模式包括遙測與工單不對齊、缺乏證據卻過度自信,以及多代理協調失效(例如,輸入被忽略)。

效能觀察與基準

社群在 225 位使用者與超過 300 個代理的評估中發現,尚無模型達到部署就緒所需的 85 分門檻。

模型效能比較

模型族群 最佳規劃分數 最佳執行分數 主要限制
GPT-4.1 68.2 72.4 在複雜工作流程中產生幻覺式完成
Mistral-Large 64.7 69.1 在多跳工具序列上表現不佳
LLaMA-4 Maverick 66.0 70.8 錯過澄清問題
LLaMA-3-70B 52.3 58.9 在多代理協調下崩潰

失效分佈

對 881 條執行追蹤的分析顯示以下失效分佈:

  • 錯誤復原無效: 31.2%
  • 完成過度聲稱: 23.8%
  • 格式問題: 21.4%
  • 未處理的工具錯誤: 10.3%
  • 忽略回饋: 8.0%
  • 其他: 5.3%

主要技術發現

  • 「聽起來正確,實際錯誤」問題: 23.8% 的代理在未能復原錯誤(31.2%)後仍聲稱任務完成並輸出成功,對工業操作員構成重大風險。
  • 工具準確度作為差異化因素: 高效能代理達到 94% 的工具準確度,低效能者則為 61%。
  • 多代理複雜度: 由於上下文遺失與連鎖失效,單一代理的任務準確率 68% 降至多代理系統的 47%。
  • 知識整合: 雖然取得失效模式資料庫與維護手冊可提升效能,但 RAG(檢索增強生成)知識並非總是正確使用,顯示需要更結構化的推理。
  • 模糊性的影響: 感測器缺失、日誌衝突與描述模糊降低了 34% 的成功率,凸顯嵌入式澄清策略的必要性。

Sources