ProvenanceGuard: MCP 에이전트를 위한 소스 인식 검증
TL;DR
허빙 페이스(Hugging Face)는 ProvenanceGuard를 출시했습니다. 이는 모델 컨텍스트 프로토콜(MCP) 에이전트를 위한 검증 계층으로, 각 사실적 주장이 답변에서 인용한 정확한 소스에 의해 뒷받침되는지 보장하여, 소스 간 혼동(failure mode)을 해결합니다.
문제: 통합된 증거는 소스 오인정을 숨깁니다
전통적인 사실성 검사기(RAGAS Faithfulness, MiniCheck, AlignScore, SummaC)는 모든 검색된 문장들을 통합한 후, 주장이 어떤 증거에 의해 지지되는지 평가합니다. 그러나 주장에서 언급한 소스가 실제로 지지하는 증거와 일치하는지 검증하지 않습니다. 이로 인해 소스 간 혼동(cross-source conflation) 이 발생합니다: 진실한 주장이 잘못된 소스(예: 계정 기록에서 인용된 환불 정책)에 의해 인용되었음에도 불구하고 정확하다고 판단됩니다. 고객 지원이나 임상 보조와 같은 데이터 민감도가 높은 분야에서는 잘못된 출처가 사실 오류만큼 해로울 수 있습니다.
"한 MCP 소스가 주장에 대한 지지를 제공할 수 있지만, 답변은 다른 소스에 이를 근거로 한다. 소스 무관한 점수는 통합된 증거에서 지지를 발견하고 이를 통과시킨다. ProvenanceGuard는 검증에 사용된 소스가 답변에서 명시적 또는 암시적으로 언급한 소스와 일치하는지 별도로 확인한다." – 논문 그림 1
ProvenanceGuard가 하는 일
ProvenanceGuard는 MCP 에이전트가 답변을 생성한 이후에 작동합니다. 도구 출력을 익명의 컨텍스트로 통합하지 않습니다. 대신 다음과 같은 절차를 수행합니다:
- 분해: 답변을 개별 주장들로 분리합니다.
- 라우팅: 유사도 모델(MiniLM)을 사용해 각 주장에 가장 관련성이 높은 MCP 소스로 라우팅합니다.
- 지지 검증: 자연어 추론(NLI) 모델(DeBERTa-v3-base-mnli-fever-anli)을 사용해 지지를 검증합니다.
- 인용 확인: 검증에 사용된 소스와 답변에서 명시적 또는 암시적으로 언급된 소스를 비교합니다.
- 출력: 각 주장에 대한 소스 판정과 전역 허용/차단 결정을 생성합니다.
만약 주장이 차단되면, RARR 스타일의 복구 루프가 소스 기반 재작성 시도 또는 안전한 응답으로 대체한 후, 검증기가 수정된 답변을 다시 평가합니다.
"검증 흐름. 소스 정체성은 통합되지 않고, 분해, 라우팅, 지지 점수, 인용 확인, 복구 과정을 통해 유지된다." – 논문 그림 2
이 아키텍처는 모델에 독립적입니다. 논문에서는 재현성을 위해 로컬 모델을 사용했지만, 적절한 캘리브레이션 후 어떤 호스팅된 임베딩, NLI, 또는 주장 분할 서비스로도 교체할 수 있습니다.
실험 결과
저자들은 환자 기록, 연구 논문, 기타 도구에 접근하는 의료용 MCP 에이전트를 대상으로 ProvenanceGuard를 평가하여 281개의 실제 추적과 40개의 답변에서 도출된 361개의 인간 주석 주장 데이터를 확보했습니다.
- 차단 성능: 전문가가 식별한 139개의 잘못된 주장 중 138개를 차단함 (F1 = 0.802).
- 소스 식별: 출처가 식별 가능한 주장 중 86%에서 정확한 소스를 선택함.
- 기준 모델과의 비교: ProvenanceGuard는 논문의 거부/차단 F1 지표에서 MiniCheck, RAGAS Faithfulness, AlignScore, SummaC-ZS를 모두 상회하며, 주장-소스 ID도 제공함.
| 검증기 | 거부/차단 F1 | 주장-소스 ID 출력 여부 |
|---|---|---|
| ProvenanceGuard | 0.802 | 예 |
| MiniCheck | 0.783 | 아니요 |
| RAGAS Faithfulness | 0.758 | 아니요 |
| AlignScore | 0.662 | 아니요 |
| SummaC-ZS | 0.436 | 아니요 |
더 어려운 소스 해석 테스트
- 유사한 소스가 많은 세트에서 ProvenanceGuard는 차단 F1이 0.846이었지만, 정확한 소스를 올바르게 식별한 경우는 50.3%에 불과하여 여전히 도전 과제가 있음을 보여줌.
- 명시된 소스를 의도적으로 변경한 통제 실험(50건)에서 ProvenanceGuard는 모든 50건의 오인용을 포착함.
차단된 답변 복구
RARR 스타일의 복구 루프는 전체 추적 실행에서 차단된 모든 답변을 해결했습니다. 대부분(144/173)은 본질적인 재작성보다는 안전한 대체 응답으로 종료되었으며, 검증 불가능한 답변보다는 "답변 없음"을 선호하는 보수적인 정책을 반영합니다. 다중 소스 스트레스 테스트에서 59개의 초기 차단 답변 중 2개만이 안전한 대체 응답으로 끝났습니다.
- 지연 시간: 로컬 구성에서 답변당 약 0.5초; NLI 및 라우팅 호출 각각 수십 밀리초 소요.
Multiverse Computing 및 광범위한 채택과의 적합성
에이전트가 단일 문장 검색 증강 생성(RAG)에서 다중 도구 MCP 워크플로우로 전환함에 따라, 출처는 사실성의 핵심 요소가 됩니다. ProvenanceGuard는 모델 재학습 없이 에이전트의 추적을 존중하는 플러그인 스타일의 검증 단계를 제공합니다.
- 채택 사례: NVIDIA의 NVFlow 금융 에이전트는 ProvenanceGuard 기반의 선택적 기반 검증 단계를 도입하여 SEC 발췌문과 비교하면서도 원래 배포를 유지했습니다.
- 커뮤니티 노출: UC 버클리에서 열린 Agentic AI Summit 2026에서 포스터로 발표됨.
ProvenanceGuard 사용 방법
전체 기술 세부사항(라우팅 히우리스틱, NLI 유도, 캘리브레이션 아블레이션, 완전한 결과 표 등)은 허빙 페이스와 arXiv(arXiv:2606.18037)에 게재된 논문에서 확인할 수 있습니다. 팀은 동일한 로컬 모델로 파이프라인을 구현하거나, 자체 캘리브레이션 및 테스트를 수행한 후 클라우드 서비스로 교체할 수 있습니다.
더 깊이 있는 분석을 원하시면 허빙 페이스의 논문을 읽거나, 통합 지원을 위해 Multiverse Computing 팀에 연락하세요.