AssetOpsBench: AIエージェントベンチマークと産業現実のギャップを埋める

TL;DR

AssetOpsBench は、汎用AIベンチマークと産業資産ライフサイクル管理の複雑さとのギャップを埋めることを目的とした新しい評価フレームワークです。孤立したタスク完了から、マルチエージェントの協調、安全性が重要な障害分析、そしてノイズの多い実世界の産業データ下でのパフォーマンスへと焦点をシフトします。

産業規模の評価データセット

AssetOpsBench は、チラーや空調ユニットなどの産業資産の管理を任されたAIエージェントをテストするための専門的な環境を提供します。このベンチマークは、産業の現実をシミュレートするために設計された大規模データセットに基づいています。

  • Sensor Data: 230万件のセンサーテレメトリポイント。
  • Scenarios: 4つのエージェントロールにわたる140以上のキュレーションされたシナリオ、専門家の入力で開発された150以上のシナリオ。
  • Work Orders: 多様な運用シナリオをカバーする4,200件の作業指示。
  • Failure Modes: 53の構造化された障害モード。

ベンチマーク内のタスクは、センサーストリームの異常検知、障害モードの推論と診断、KPIの予測と分析、作業指示の要約と優先順位付けという4つの主要カテゴリにまたがります。

6次元定性的評価

AssetOpsBench は、二元的な成功指標に依存するのではなく、意思決定が実行可能で証拠に基づくものとなるよう、エージェントシステムを6つの定性的次元で評価します。

  1. タスク完了
  2. 検索精度
  3. 結果検証
  4. シーケンスの正確性
  5. 明確さと正当化
  6. 幻覚率

初期評価では、汎用エージェントは表面的な推論をうまく処理できるものの、マルチステップの協調、時間的依存関係、障害の意味論に苦労していることが示されています。フレームワークは、単純な成功シグナルよりもエージェントが失敗する理由の理解を優先し、これはハイリスクな産業環境において重要です。

軌道レベルの障害分析 (TrajFM)

AssetOpsBench は障害モードを第一級の評価シグナルとして扱います。TrajFM と呼ばれる専用パイプラインを通じて、システムはマルチエージェント実行軌道全体を分析し、3段階のプロセスで特定の障害ポイントを特定します。

  1. 抽出: LLM ガイド付き診断プロンプトが軌道から障害を抽出します。
  2. クラスタリング: 埋め込みベースのクラスタリングが繰り返し現れる障害パターンをグループ化します。
  3. 可視化: 分析と可視化が開発者のイテレーションを支援します。

このシステムは、固定された分類体系だけに依存せず、動的に新しい障害パターンを発見するよう設計されています。特定された一般的な産業障害モードには、テレメトリと作業指示の不整合、証拠が欠如しているにもかかわらずの過信、マルチエージェント協調の崩壊(例:入力が無視される)などがあります。

パフォーマンス観測とベンチマーク

225人のユーザーと300以上のエージェントにわたるコミュニティ評価の結果、現在のところ、デプロイ準備に必要な85点の閾値を満たすモデルは存在しませんでした。

モデルパフォーマンス比較

モデルファミリー 最高計画スコア 最高実行スコア 主な制限
GPT-4.1 68.2 72.4 複雑なワークフローでの幻覚的な完了
Mistral-Large 64.7 69.1 マルチホップツールシーケンスで苦戦
LLaMA-4 Maverick 66.0 70.8 明確化質問を見逃す
LLaMA-3-70B 52.3 58.9 マルチエージェント協調で崩壊

障害の分布

881件の実行トレースの分析により、以下の障害分布が示されました:

  • 効果的でないエラー回復: 31.2%
  • 過大な完了報告: 23.8%
  • フォーマット問題: 21.4%
  • 未処理のツールエラー: 10.3%
  • フィードバック無視: 8.0%
  • その他: 5.3%

主な技術的所見

  • 「正しく聞こえるが実際は間違い」問題: エージェントの23.8%がエラーから回復できず(31.2%)にもかかわらずタスク完了と成功出力を主張し、産業オペレーターに重大なリスクをもたらします。
  • ツール精度が差別化要因: 高性能エージェントは94%のツール精度を達成し、低性能エージェントは61%でした。
  • マルチエージェントの複雑性: コンテキスト喪失と連鎖的障害により、単一エージェントのタスク精度68%がマルチエージェントシステムでは47%に低下します。
  • 知識統合: 障害モードデータベースや保守マニュアルへのアクセスはパフォーマンス向上に寄与しますが、RAG(検索強化生成)知識が常に正しく使用されているわけではなく、より構造化された推論が必要です。
  • 曖昧さの影響: センサー欠損、ログの矛盾、曖昧な記述により成功率が34%低下し、組み込みの明確化戦略の必要性が浮き彫りになっています。

Sources