MosaicLeaks:解决深度研究代理中的隐私泄漏问题

MosaicLeaks:解决深度研究代理中的隐私泄漏问题

深度研究代理在将本地私有文档与外部网络检索相结合时,面临一种称为“马赛克效应”的重大隐私风险——多个看似无害的外部查询被观察者重新组合后可能泄露敏感信息。Hugging Face 推出了 MosaicLeaks 基准,用于衡量此类泄漏,并提出 Privacy-Aware Deep Research (PA-DR)——一种强化学习(RL)训练方法,可在保持高任务性能的同时,将答案泄漏和完整信息泄漏率从 34.0% 降至 9.9%。

马赛克效应与隐私泄漏

马赛克效应指的是,攻击者通过分析代理的累计查询日志,即使单个查询本身并未直接透露秘密,也能推断出私有信息。MosaicLeaks 根据攻击者能够从网络查询日志中推断出的内容,将泄漏划分为三个层级:

  • 意图泄漏:攻击者能够推断出代理正在研究的私有研究目标或问题。
  • 答案泄漏:攻击者仅凭查询日志(无需访问私有文档)就能回答关于私有信息的具体问题。
  • 完整信息泄漏:攻击者能够在没有特定提问的情况下,直接陈述可验证的真实私有声明。

MosaicLeaks 基准

MosaicLeaks 包含 1,001 条多跳研究链,这些链交替使用本地企业文档和受控网络语料库。该基准通过要求代理在形成下一个有用的网络查询之前必须先检索本地信息,从而诱发隐私泄漏。

链构建

研究链的构建分为三个阶段:

  1. 种子私有事实:从企业文档中生成私有问答对(指标、日期、实体等)。
  2. 桥接文档:利用前一步的答案检索新文档并生成后续问题,形成本地‑网络依赖。
  3. 验证链:确保可回答性、可检索性,并且前一步的答案对下一跳是严格必要的。

基于提示的隐私防护的失败

通过提示(例如指示代理在网络查询中不泄露本地信息)来防止泄漏的尝试表现出不一致且常常损害性能的结果。对 Qwen3-4B 模型而言,使用隐私感知提示将答案/完整信息泄漏率从 34.0% 降至 25.5%,但严格链成功率却从 48.7% 降至 44.5%。提示的主要效果是减少了网络查询的总次数,而不是构造更安全的查询。

性能与隐私的权衡

仅为任务性能而训练代理会提升隐私风险。在 Qwen3-4B 的实验中,仅针对严格链成功进行训练将成功率从 48.7% 提升至 59.3%,但同时将答案/完整信息泄漏率从 34.0% 提升至 51.7%。这是因为模型学会在查询中塞入更多上下文以提升检索效果,从而为攻击者提供了更多碎片进行重组。

Privacy-Aware Deep Research (PA-DR)

PA-DR 是一种强化学习训练方法,通过两类独立奖励同时优化任务成功率和隐私保护:

1. 情境任务奖励

PA-DR 不对整条轨迹打分,而是使用情境奖励,对同一阶段、同一跳、使用相同信息的不同模型调用进行比较。这为具体行为(如规划正确来源的搜索或选择正确文档)提供了精确的信用分配。

2. 学习的隐私奖励

一个基于 Qwen3-4B 的分类器会为每个网络查询估计两种风险:直接泄漏私有信息的风险,以及加入现有日志后产生新的马赛克泄漏的风险。代理会根据这两者中较大的风险受到惩罚。

结果

PA-DR 在不牺牲任务‑仅训练所带来的性能提升的前提下,大幅降低了泄漏率:

方法 严格链成功率 答案或完整信息泄漏率
Base Qwen3-4B 48.7% 34.0%
Task reward 59.3% 51.7%
Task + PA-DR reward 58.7% 9.9%

PA-DR 的实现并非通过减少检索次数,而是通过在查询文本中去除会泄露细节(如具体指标或日期)的信息,同时仍能检索到正确的公开文档。

训练效率

情境奖励相比仅基于结果的 RL 具有显著的样本效率优势。PA-DR 只使用约 183k 条生成样本即可达到 55% 的严格链成功率,而基于结果奖励的训练则需要约 963k 条样本。

适用范围与局限性

MosaicLeaks 是使用合成企业文档和固定网络语料库构建的受控基准。虽然它展示了隐私不能仅靠“提示注入”,而必须通过“训练注入”,但结果仅针对单一代理框架和多跳问答任务。对于开放式研究和真实场景的部署仍需进一步研究。


摘要: Hugging Face 推出 MosaicLeaks 基准以及 Privacy-Aware Deep Research (PA-DR) 训练方法,以防止研究代理通过外部网络查询泄露企业私有数据。

标题: MosaicLeaks:解决深度研究代理中的隐私泄漏问题

Sources