ProvenanceGuard:面向MCP代理的溯源感知验证

TL;DR

Hugging Face发布了 ProvenanceGuard,这是Model Context Protocol (MCP) 代理的验证层,确保每个事实性主张都有其答案所归因的精确来源,解决了跨源混淆这一失效模式。

问题:聚合证据掩盖了来源误标

传统的事实核查器(RAGAS Faithfulness、MiniCheck、AlignScore、SummaC)在聚合所有检索到的段落后,评估某个主张是否被任何证据支持。它们并不验证主张所声称的来源是否与实际支持它的证据匹配。这导致了 跨源混淆:即使主张被错误地归因于某个来源(例如,将退款政策归为账户记录),只要该主张本身为真,仍会被标记为正确。在客户支持或临床辅助等数据敏感领域,错误的溯源可能与事实性错误一样有害。

"一个主张可以由一个MCP来源支持,但答案却将其归因于另一个来源。源盲评分会看到聚合证据中的支持并予以通过;而ProvenanceGuard则分别检查支持来源是否与答案明确或隐含提及的来源一致。" – 论文图1

ProvenanceGuard的作用

ProvenanceGuard 在MCP代理生成答案后运行。它从不将工具输出合并为匿名上下文。相反,它:

  1. 分解 答案为单个主张。
  2. 使用相似性模型(论文中为MiniLM)将每个主张路由到最相关的MCP来源。
  3. 使用自然语言推理(NLI)模型(DeBERTa-v3-base-mnli-fever-anli)验证支持。
  4. 通过比较用于验证的来源与答案中明确或隐含提及的来源,检查归因。
  5. 输出 每个主张的来源判断结果以及全局允许/阻止决策。

如果某个主张被阻止,会启动类似RARR的修复循环,尝试基于来源重写或回退至安全响应,之后验证器重新评估修改后的答案。

"验证流程。源身份通过分解、路由、支持评分、归因检查和修复得以保留,而非被聚合。" – 论文图2

该架构与模型无关:论文使用本地模型以保证可复现性,但经过适当校准后,任何托管嵌入、NLI或主张拆分服务均可替代它们。

实证结果

作者在访问患者记录、研究文章及其他工具的医疗MCP代理上评估了ProvenanceGuard,共获得281条真实轨迹和来自40个回答的361条人工标注主张。

  • 阻止性能:139个专家识别出的错误主张中有138个被阻止(F1 = 0.802)。
  • 来源识别:对于可识别溯源的主张,正确来源被选中的比例为86%。
  • 与基线对比:在论文的拒绝/阻止F1指标上,ProvenanceGuard优于MiniCheck、RAGAS Faithfulness、AlignScore和SummaC-ZS,同时还能提供主张到来源的ID。
验证器 拒绝/阻止 F1 输出主张到来源ID
ProvenanceGuard 0.802 是
MiniCheck 0.783 否
RAGAS Faithfulness 0.758 否
AlignScore 0.662 否
SummaC-ZS 0.436 否

更难的来源消歧测试

  • 在一组具有许多相似来源的数据上,ProvenanceGuard实现了0.846的F1阻断率,但仅在50.3%的时间内正确识别了确切来源,凸显了仍存在的挑战。
  • 在受控交换实验中(50个案例中故意更改命名来源),ProvenanceGuard成功捕获了全部50个误归因情况。

修复被阻止的答案

RARR风格的修复循环在完整轨迹运行中解决了每一个被阻止的答案。大多数(144/173)最终以安全回退结束,而非实质性重写,反映出一种保守策略——宁愿“无答案”也不接受不可验证的回答。在多源压力测试中,59个最初被阻止的答案经修复后仅出现两次回退。

  • 延迟:在本地配置下,每条答案约0.5秒;NLI和路由调用各耗时数十毫秒。

与Multiverse Computing及更广泛采用的契合

随着代理从单段落检索增强生成(RAG)过渡到多工具MCP工作流,溯源成为事实性的核心组成部分。ProvenanceGuard提供了一个插件式验证阶段,尊重代理的执行轨迹,无需重新训练模型。

  • 采用示例:NVIDIA的NVFlow金融代理集成了一个可选的基于ProvenanceGuard的溯源验证阶段,在保留原始执行轨迹的同时,对答案与SEC摘录进行核对。
  • 社区曝光:作为海报展示于Agentic AI Summit 2026(UC Berkeley)。

如何获取ProvenanceGuard

完整的技术细节——包括路由启发式、NLI推导、校准消融分析以及完整的结果表格——可在Hugging Face和arXiv(arXiv:2606.18037)上的论文中找到。团队可使用相同的本地模型实现该流水线,或替换为云服务,前提是自行完成校准和测试。


如需深入探讨,请阅读Hugging Face上的论文,或联系Multiverse Computing团队获取集成支持。

Sources