MosaicLeaks:解決深度研究代理的隱私洩漏問題
MosaicLeaks:解決深度研究代理的隱私洩漏問題
結合私密本地文件與外部網路檢索的深度研究代理面臨一種稱為「馬賽克效應」的重大隱私風險,觀察者可以將多個看似無害的外部查詢重新組合,從而揭露敏感資訊。Hugging Face 推出了 MosaicLeaks,用於衡量此類洩漏的基準,以及 Privacy-Aware Deep Research (PA-DR),一種強化學習訓練方法,能將答案與完整資訊洩漏率從 34.0% 降至 9.9%,同時保持高任務表現。
馬賽克效應與隱私洩漏
當代理的累積查詢紀錄使對手能推斷出私密資訊,即使單一查詢並未明確揭露秘密時,就會產生馬賽克效應。MosaicLeaks 根據對手從網路查詢紀錄中能推斷出的資訊,定義了三個洩漏層級:
- Intent leakage:對手能推斷出代理正在調查的私密研究目標或問題。
- Answer leakage:對手可利用查詢紀錄回答關於私密資訊的特定問題,且不需要存取私密文件。
- Full-information leakage:對手能在未被特定問題提示的情況下,陳述可驗證為真的私密主張。
MosaicLeaks 基準
MosaicLeaks 包含 1,001 條多跳研究鏈,交錯本地企業文件與受控的網路語料庫。此基準旨在透過要求代理先檢索本地資訊,才能形成下一個有用的網路查詢,從而誘發隱私洩漏。
鏈路建構
研究鏈分為三個階段建構:
- Seed private facts:從企業文件中產生私密問答對(指標、日期、實體)。
- Bridge documents:利用先前的答案檢索新文件並產生後續問題,形成本地與網路的依賴關係。
- Validate chains:確保可回答性、可檢索性,且前一個答案對於下一跳是嚴格必要的。
基於提示的隱私防護失效
透過提示(例如指示代理在網路查詢中不洩漏本地資訊)來防止洩漏的嘗試,結果不穩定且常對效能有負面影響。以 Qwen3-4B 模型為例,隱私感知提示將答案/完整資訊洩漏率從 34.0% 降至 25.5%,但嚴格鏈路成功率從 48.7% 降至 44.5%。提示的主要效果是減少了網路查詢的總數,而非構造更安全的查詢。
效能與隱私的權衡
僅針對任務效能訓練代理會提升隱私風險。在 Qwen3-4B 的測試中,僅訓練以提升嚴格鏈路成功率,使成功率從 48.7% 提升至 59.3%,但同時將答案/完整資訊洩漏率從 34.0% 增至 51.7%。這是因為模型學會在查詢中加入更多上下文以改善檢索,從而提供更多碎片讓對手重新組合。
隱私感知深度研究(PA-DR)
PA-DR 是一種強化學習訓練方法,透過兩種不同的獎勵,同時優化任務成功與隱私:
1. 情境任務獎勵
PA-DR 不對整條軌跡打分,而是使用情境獎勵,對同一階段、同一跳且使用相同資訊的模型呼叫進行比較。此方式能為具體行動(如規劃搜尋正確來源或選擇正確文件)提供精確的信用分配。
2. 學習式隱私獎勵
Qwen3-4B 分類器會為每個網路查詢估計兩種風險:私密資訊的直接洩漏,以及加入現有紀錄後產生的新馬賽克洩漏。代理會根據兩者較大的風險受到懲罰。
結果
| 方法 | 嚴格鏈路成功率 | 答案或完整資訊洩漏率 |
|---|---|---|
| Base Qwen3-4B | 48.7% | 34.0% |
| Task reward | 59.3% | 51.7% |
| Task + PA-DR reward | 58.7% | 9.9% |
PA-DR 的達成方式並非減少搜尋次數,而是從查詢文字中移除揭露細節(例如特定指標或日期),同時仍能檢索到正確的公開文件。
訓練效率
情境獎勵的樣本效率遠高於僅使用結果的強化學習。PA-DR 以約 183k 生成樣本即可達到 55% 的嚴格鏈路成功率,而結果獎勵訓練則需約 963k 樣本。
範圍與限制
MosaicLeaks 是使用合成企業文件與固定網路語料庫的受控基準。雖然它證明了隱私無法透過「提示」而是必須「訓練」才能實現,但結果僅適用於單一代理框架與多跳問答任務。未來仍需針對開放式研究與實際部署進行更深入的研究。