ProvenanceGuard 針對 MCP 代理的來源感知驗證

TL;DR

Hugging Face 發布了 ProvenanceGuard,這是一種 Model Context Protocol (MCP) 代理的驗證層,可確保每個事實性主張都由答案所歸因的精確來源支持,從而解決跨來源混淆的失敗模式。

問題:合併的證據會隱藏來源誤歸因

傳統的事實正確性檢查工具(RAGAS Faithfulness、MiniCheck、AlignScore、SummaC)在合併所有檢索到的段落後,評估主張是否被 任何 證據支持。它們不會驗證主張所聲稱的來源是否與實際支持它的證據相符。這導致了 跨來源混淆:即使主張歸因於錯誤的來源(例如,將退款政策歸因於帳戶記錄),只要主張本身為真,仍會被標記為正確。在客戶支援或臨床協助等資料敏感領域,錯誤的來源可能與事實錯誤一樣有害。

"一個主張可能由一個 MCP 來源支持,但答案卻將其歸因於另一個來源。來源無知的評分會在合併的證據中看到支持,並通過驗證;而 ProvenanceGuard 則獨立檢查支持來源是否與答案明確或隱含提及的來源相符。" – 論文 圖 1

ProvenanceGuard 的功能

ProvenanceGuard 在 MCP 代理生成答案後運作。它從不將工具輸出合併為匿名上下文。相反,它:

  1. 分解答案為單獨的主張。
  2. 使用相似度模型(論文中為 MiniLM)將每個主張路由至最相關的 MCP 來源。
  3. 使用自然語言推論(NLI)模型(DeBERTa‑v3‑base‑mnli‑fever‑anli)驗證支持。
  4. 通過比較驗證所用來源與答案中明確或隱含提及的來源,檢查歸因。
  5. 輸出每個主張的來源判決以及全局允許/阻止決策。

若某主張被阻止,會啟動類似 RARR 的修復循環,嘗試進行基於來源的重寫,或退回到安全回應,之後驗證器會重新評估修復後的答案。

"驗證流程。來源身分透過分解、路由、支持評分、歸因檢查和修復得以保留,而非被合併。" – 論文 圖 2

該架構與模型無關:論文使用本地模型以確保可重現性,但任何託管嵌入、NLI 或主張拆分服務均可在適當校準後取代它們。

實證結果

作者在一個訪問患者記錄、研究文章及其他工具的醫療 MCP 代理上評估了 ProvenanceGuard,產生了 281 個真實追蹤和 40 個答案中的 361 個人工標註主張。

  • 阻止效能:139 個專家識別的錯誤主張中,有 138 個被阻止(F1 = 0.802)。
  • 來源識別:86 % 的可識別來源主張正確選取了來源。
  • 與基線比較:ProvenanceGuard 在論文的拒絕/阻止 F1 指標上優於 MiniCheck、RAGAS Faithfulness、AlignScore 和 SummaC‑ZS,同時還提供主張到來源的 ID。
驗證器 拒絕/阻止 F1 輸出主張到來源 ID
ProvenanceGuard 0.802 是
MiniCheck 0.783 否
RAGAS Faithfulness 0.758 否
AlignScore 0.662 否
SummaC‑ZS 0.436 否

更困難的來源歧義測試

  • 在包含許多相似來源的集合上,ProvenanceGuard 的阻止 F1 為 0.846,但僅有 50.3 % 的時間正確識別出精確來源,突顯了仍存在的挑戰。
  • 在受控交換實驗中(50 個案例中故意更改命名來源),ProvenanceGuard 成功捕捉了 全部 50 個誤歸因。

修復被阻止的答案

RARR 風格的修復循環在完整追蹤運行中解決了所有被阻止的答案。大多數(144/173)以安全回退結束,而非實質性重寫,反映出一種保守策略,即寧願「無答案」也不願提供無法驗證的答案。在多來源壓力測試中,59 個最初被阻止的答案僅有兩次回退即成功修復。

  • 延遲:在本地配置下,每答案約 0.5 秒;NLI 和路由呼叫各需數十毫秒。

與 Multiverse Computing 的契合與廣泛採用

隨著代理從單一段落檢索增強生成(RAG)過渡到多工具 MCP 工作流程,來源成為正確性的核心。ProvenanceGuard 提供了一個插件式驗證階段,尊重代理的追蹤,無需重新訓練模型。

  • 採用範例:NVIDIA 的 NVFlow 財務代理整合了一個可選的基於 ProvenanceGuard 的來源驗證階段,在保留原始部署的同時,對答案與 SEC 摘錄進行核對。
  • 社群曝光:於 2026 年 Agentic AI Summit(UC Berkeley)以海報形式發表。

如何取得 ProvenanceGuard

完整的技術細節——包括路由啟發式、NLI 推導、校準消融實驗以及完整結果表格——可在 Hugging Face 和 arXiv(arXiv:2606.18037)上的論文中取得。團隊可使用相同的本地模型實現此流程,或替換為雲服務,前提是自行進行校準與測試。


如需深入探討,請閱讀 Hugging Face 上的論文,或聯繫 Multiverse Computing 團隊以獲取整合支援。

Sources