ProvenanceGuard source-aware verification for MCP agents

TL;DR

Hugging FaceはProvenanceGuardをリリースしました。これはModel Context Protocol (MCP)エージェント用の検証レイヤーであり、各事実的主張が回答が帰属する正確なソースによって裏付けられていることを保証し、複数ソースの混同という失敗モードに対処します。

問題:統合された証拠はソースの誤帰属を隠す

従来の事実性チェックツール(RAGAS Faithfulness、MiniCheck、AlignScore、SummaC)は、取得したすべての文章を統合した後、主張がいずれかの証拠によって支持されているかどうかを評価します。しかし、主張に明示されたソースが実際に支持している証拠と一致しているかどうかは検証しません。これにより複数ソースの混同が発生します:正しい主張でも、誤ったソースに帰属されている場合(例:アカウント記録から返金ポリシーを引用している)に正解として扱われます。顧客サポートや臨床支援などデータに敏感な分野では、誤った出典は事実の誤りと同等に有害です。

"ある主張が1つのMCPソースによって支持されている一方で、回答は別のソースに帰属させている可能性がある。ソース無視型スコアリングは統合された証拠に支持を見出し、それを通すが、ProvenanceGuardは検証に使われたソースが、回答で明示的または暗黙的に言及されているものと一致しているかを別途確認する。" – 論文 Figure 1

ProvenanceGuardの機能

ProvenanceGuardはMCPエージェントが回答を生成した後に動作します。ツール出力を匿名的なコンテキストに統合することはありません。代わりに、以下の手順を実行します:

  1. 分解:回答を個々の主張に分割する。
  2. ルーティング:類似度モデル(論文中ではMiniLM)を使用して、各主張を最も関連性の高いMCPソースにルーティングする。
  3. 支持の検証:自然言語推論(NLI)モデル(DeBERTa‑v3‑base‑mnli‑fever‑anli)を使って支持を検証する。
  4. 帰属の確認:検証に使用されたソースと、回答に明示的または暗黙的に言及されているソースを比較する。
  5. 出力:個別主張ごとのソース評価結果と、全体的な許可/ブロック判断を出力する。

主張がブロックされた場合、RARRスタイルの修復ループが、ソースに基づいた再書き直しを試みるか、安全な応答にフォールバックし、その後検証器が修正された回答を再評価します。

"検証フロー。ソースの同一性は、分解、ルーティング、支持スコアリング、帰属確認、修復の各段階で保持される。統合されない。" – 論文 Figure 2

このアーキテクチャはモデル非依存です。論文中では再現性のためにローカルモデルを使用しましたが、適切なキャリブレーションを行えば、ホストされた埋め込み、NLI、または主張分割サービスを任意に置き換えることができます。

実証結果

著者らは、患者記録、研究論文、その他のツールにアクセスする医療用MCPエージェント上でProvenanceGuardを評価し、281件の実際のトレースと40件の回答から得られた361件の人間による主張ラベルを用いました。

  • ブロッキング性能:専門家が特定した不良主張139件のうち138件がブロックされた(F1 = 0.802)。
  • ソース識別:出典が特定可能な主張の86 %で正しいソースが選ばれた。
  • ベースラインとの比較:論文の拒否/ブロックF1指標において、ProvenanceGuardはMiniCheck、RAGAS Faithfulness、AlignScore、SummaC‑ZSを上回り、さらに主張からソースへのIDマッピングも提供した。
検証器 拒否/ブロックF1 主張からソースへのID出力
ProvenanceGuard 0.802 Yes
MiniCheck 0.783 No
RAGAS Faithfulness 0.758 No
AlignScore 0.662 No
SummaC‑ZS 0.436 No

より困難なソースの曖昧さテスト

  • 同じような多数のソースを持つセットでは、ブロッキングのF1は0.846でしたが、正確なソースを識別できたのは50.3 %に留まり、依然として課題が残っていることを示しています。
  • 制御された交換実験(名前付きソースを意図的に変更した50ケース)では、ProvenanceGuardはすべての50件の誤帰属を検出しました。

ブロックされた回答の修復

RARRスタイルの修復ループは、フルトレース実行におけるすべてのブロックされた回答を解決しました。大多数(144/173)は本質的な再書き直しではなく、安全なフォールバックで終了しており、検証不能な回答より「答えなし」を選ぶ保守的な方針を反映しています。マルチソースストレステストでは、初期にブロックされた59件の回答のうち、わずか2件のフォールバックで修復されました。

  • レイテンシ:ローカル構成では1回答あたり約0.5秒。NLIおよびルーティング呼び出しはそれぞれ数十ミリ秒かかります。

Multiverse Computingとの適合性および広範な採用

エージェントが単一の文章取得増強生成(RAG)からマルチツールMCPワークフローへ移行する中で、出典は事実性の不可欠な要素となります。ProvenanceGuardは、エージェントのトレースを再訓練せずに尊重するプラグイン型検証ステージを提供します。

  • 採用事例:NVIDIAのNVFlow財務エージェントは、ProvenanceGuardに基づくオプションの根拠検証ステージを導入し、SEC抜粋と照合しながら元の展開を維持しました。
  • コミュニティ露出:Agentic AI Summit 2026(UC Berkeley)にてポスター発表されました。

ProvenanceGuardの入手方法

詳細な技術仕様(ルーティングヒューリスティックス、NLIの導出、キャリブレーションアブラーション、完全な結果表など)は、Hugging FaceおよびarXiv(arXiv:2606.18037)の論文で公開されています。チームは同じローカルモデルでパイプラインを実装できるほか、独自のキャリブレーションとテストを実施すればクラウドサービスに置き換えることも可能です。


より深い理解のために、Hugging Face上の論文を読むか、統合サポートのためMultiverse Computingチームに連絡してください。

Sources