AssetOpsBench:彌合 AI 代理基準與工業現實之間的差距
TL;DR
AssetOpsBench 是一個新型評估框架,旨在彌合通用 AI 基準與工業資產生命週期管理之間的複雜性差距。它將焦點從單一任務完成轉向多代理協調、安全關鍵的失效分析,以及在噪聲龐雜的真實工業數據下的表現。
工業規模評估資料集
AssetOpsBench 提供一個專門環境,用於測試負責管理工業資產(如冷水機與空氣處理裝置)的 AI 代理。此基準以一個龐大的資料集為基礎,旨在模擬工業現實:
- 感測器資料: 230 萬筆感測遙測點。
- 情境: 超過 140 個精選情境,涵蓋四種代理角色,另有 150 多個情境由專家參與開發。
- 工單: 4,200 張工單,涵蓋多樣的運營情境。
- 失效模式: 53 種結構化失效模式。
基準內的任務涵蓋四大類別:感測器串流的異常偵測、失效模式推理與診斷、關鍵績效指標(KPI)預測與分析,以及工單的摘要與優先排序。
六維質性評估
AssetOpsBench 不依賴二元成功指標,而是從六個質性維度評估代理系統,以確保決策可執行且有據可依:
- 任務完成
- 檢索準確度
- 結果驗證
- 序列正確性
- 清晰度與論證
- 幻覺率
早期評估顯示,雖然通用代理在表層推理上表現良好,但在多步協調、時間依賴性以及失效語義上仍有困難。框架優先關注了解代理失敗的原因,而非僅僅的成功訊號,這對高風險的工業環境至關重要。
軌跡層級失效分析(TrajFM)
AssetOpsBench 將失效模式視為一級評估訊號。透過名為 TrajFM 的專屬管線,系統分析完整的多代理執行軌跡,藉由三階段流程辨識具體的失效點:
- 抽取: 由 LLM 引導的診斷提示從軌跡中抽取失效。
- 聚類: 基於嵌入的聚類將重複的失效模式分組。
- 可視化: 分析與可視化支援開發者迭代。
此系統旨在動態發掘新失效模式,而非僅依賴固定分類。常見的工業失效模式包括遙測與工單不對齊、缺乏證據卻過度自信,以及多代理協調失效(例如,輸入被忽略)。
效能觀察與基準
社群在 225 位使用者與超過 300 個代理的評估中發現,尚無模型達到部署就緒所需的 85 分門檻。
模型效能比較
| 模型族群 | 最佳規劃分數 | 最佳執行分數 | 主要限制 |
|---|---|---|---|
| GPT-4.1 | 68.2 | 72.4 | 在複雜工作流程中產生幻覺式完成 |
| Mistral-Large | 64.7 | 69.1 | 在多跳工具序列上表現不佳 |
| LLaMA-4 Maverick | 66.0 | 70.8 | 錯過澄清問題 |
| LLaMA-3-70B | 52.3 | 58.9 | 在多代理協調下崩潰 |
失效分佈
對 881 條執行追蹤的分析顯示以下失效分佈:
- 錯誤復原無效: 31.2%
- 完成過度聲稱: 23.8%
- 格式問題: 21.4%
- 未處理的工具錯誤: 10.3%
- 忽略回饋: 8.0%
- 其他: 5.3%
主要技術發現
- 「聽起來正確,實際錯誤」問題: 23.8% 的代理在未能復原錯誤(31.2%)後仍聲稱任務完成並輸出成功,對工業操作員構成重大風險。
- 工具準確度作為差異化因素: 高效能代理達到 94% 的工具準確度,低效能者則為 61%。
- 多代理複雜度: 由於上下文遺失與連鎖失效,單一代理的任務準確率 68% 降至多代理系統的 47%。
- 知識整合: 雖然取得失效模式資料庫與維護手冊可提升效能,但 RAG(檢索增強生成)知識並非總是正確使用,顯示需要更結構化的推理。
- 模糊性的影響: 感測器缺失、日誌衝突與描述模糊降低了 34% 的成功率,凸顯嵌入式澄清策略的必要性。