对话式AI服务将敏感数据泄露给广告商——对9大平台的隐私分析

关键发现

所有被调查的九个对话式AI服务都在其网页和移动端客户端中嵌入了第三方广告或追踪服务(ATSes),且许多服务会将对话生成的各类数据——如标题、提示、截图和永久链接——连同持久用户标识符一起传输,从而产生新的隐私风险。


测量范围

  • 调查的服务:ChatGPT、Claude、Gemini、Grok、DeepSeek、Perplexity、Copilot、Mistral 和 Meta AI。
  • 客户端:全部九个服务的网页前端,以及八个服务的Android应用(不包括DeepSeek移动端)。
  • 方法论:结合静态反编译(Androguard)与动态插桩(Chrome DevTools、插桩Pixel 3a、mitmproxy、Frida),以捕获网络流量、存储写入和SDK使用情况。
  • 实验矩阵:在Cookie同意选择(忽略、拒绝全部、接受全部)、订阅层级(访客、免费、付费)和隐私模式(可用时为无痕模式)下进行测试。
  • 数据:18页PDF报告,44家第三方组织,124个独立域名,44个ATS,以及负责任披露日志。

第三方追踪生态

  • 普遍存在:每个服务都至少联系一个ATS;平均每个服务有44个独立的第三方域名。
  • 主导玩家:Google产品(广告、标签管理器、分析、Firebase)出现在全部9个服务中;其他常见合作伙伴包括Meta Pixel、TikTok分析、Sentry、Datadog和Intercom。
  • 网页 vs. 移动端:11个ATS同时存在于两个平台,15个仅存在于网页端(如OneTrust、TikTok),8个仅存在于移动端(如Braze)。移动端流量71%由WebView驱动,加剧了应用内的网页式追踪。

对话生成数据泄露

数据项 网页泄露(服务数) 移动端泄露(服务数)
对话URL / 永久链接 9个中的5个 8个中的0个
对话ID(不含完整URL) 9个中的2个 8个中的1个
用户提示 9个中的1个 8个中的1个
对话标题(AI生成摘要) 9个中的3个 8个中的0个
截图(共享视图) 9个中的1个 8个中的0个
共享对话URL 9个中的5个 8个中的0个
共享对话ID 0个 8个中的1个
  • 机制:URL和标题作为查询参数或JSON字段发送至Google Ads、Meta Pixel、TikTok和Datadog等追踪器。
  • 同意影响:接受非必要Cookie会激活额外追踪器(如Meta、TikTok、DoubleClick)。拒绝Cookie后仍有44%的服务向第三方传输数据。
  • 订阅层级影响:免费与付费层级之间差异微小;仅Claude的移动端在高级订阅中移除了Intercom/Sentry。

将数据与持久标识符关联

  • 观察到的标识符:哈希邮箱地址(HEMs)、账户用户名、提供商特定ID、Android广告ID(AAID),以及诸如_fbp(Meta)和_ttp(TikTok)等Cookie。
  • 跨链接:追踪器同时接收对话数据和标识符,使其能够将聊天内容与跨设备和服务的长期用户档案关联起来。
  • 服务器端转发:Claude使用Segment Analytics将事件从服务器端转发至十一个广告网络,绕过广告拦截器。
  • 仅限网页 vs. 仅限移动端:
    • 网页追踪器接收标题和URL;移动端SDK主要接收ID,在少数情况下接收邮箱哈希。
    • 基于WebView的移动端流量复制了相同提供商的网页泄露模式。

公开可访问的永久链接

  • 访问控制矩阵(访客 / 免费 / 付费):
    • ChatGPT、Claude、Gemini、Copilot、Mistral:默认仅所有者可访问(可选退出)。
    • Grok:默认公开,可退出;Perplexity:访客层级始终公开。
  • 影响:任何持有永久链接的人都可在无需认证的情况下检索完整对话,暴露可能涉及健康、金融或个人的敏感数据。

现实世界的数据检索证据

  • 信标令牌实验:在提示和上传文档中嵌入唯一URL。
  • 结果:
    • Grok在数日内触发来自14个国家48个AS的70次不同访问(65%来自美国)。
    • Perplexity、Copilot、Mistral和Claude显示出来自云服务商的单次访问。
  • 解读:第三方积极检索共享的对话资源,证实泄露并非仅为理论推测。

法律评估(欧盟GDPR与ePrivacy)

  • ePrivacy指令:第5(3)条要求在Cookie、追踪像素和基于URL的追踪前获得事先知情同意。许多服务即使在用户拒绝非必要Cookie的情况下仍传输追踪数据,违反该条款。
  • GDPR:对话内容和标识符的处理构成个人数据。提供商往往缺乏透明披露,且除“合同履行”外缺乏合法依据。欧洲法院(Meta Platforms Ireland)要求明确告知数据类别、目的和法律基础——多数服务未满足这些要求。
  • 特殊类别数据风险:研究中使用的与健康相关的提示可能触发GDPR特殊类别数据处理,但未见明确保护措施。

影响讨论

  • 隐私风险放大:对话式AI为现有广告技术生态系统增加了丰富且蕴含意图的数据(标题、提示),使更精细的画像成为可能。
  • 用户控制无效:Cookie同意横幅和分层订阅提供的缓解作用有限;拒绝Cookie后仍有80%的追踪器保持活跃。
  • 更广泛生态系统:发现可能适用于自定义聊天机器人、基于LLM的网页组件及企业级代理,它们复用了相同的SDK。
  • 滥用潜力:公开永久链接结合追踪器访问,可能被用于定向钓鱼、勒索或监视。

缓解建议

  1. 默认禁止分享:提供商应默认将对话永久链接设为私密,并要求用户主动操作才能生成可分享链接。
  2. 传输前剥离数据:在发送至第三方ATS的请求中移除标题、提示和URL,除非用户明确选择启用。
  3. 分离广告技术与AI流程:部署专用广告技术容器,不接收AI生成内容。
  4. 强化同意UI:实施细粒度、无需预勾选框的同意对话框,除非用户接受,否则阻止所有非必要追踪器。
  5. 监管监督:数据保护机构应对披露的数据流进行审计,确保符合GDPR/ePrivacy要求,尤其针对与健康相关的提示。
  6. 用户侧工具:鼓励使用注重隐私的浏览器(Brave、Tor)和移动端隐私仪表板;考虑对AI代理进行沙箱化(如cellmate),以限制SDK权限。

社区反应(Hacker News精选)

"多个提供商将敏感的对话衍生数据——包括标题、提示和截图——披露给第三方,常伴随持久用户标识符,使用户可被识别。我们还发现,部分提供商公开暴露对话永久链接而无访问控制,允许追踪器读取整个对话。" – Coeur

"如果这是商业模式,那就不是泄漏。" – drywater2(指出这是有意出售数据,而非意外泄露。)

"广告技术花了20年试图从点击流推断意图。现在聊天应用直接提供一条AI撰写的意图摘要,带有标签并绑定到Cookie。" – vivekpolavarapu(强调画像的新精度。)

"我自行搭建了聊天界面以避免此问题。" – 0xcrypto(建议自托管替代方案。)


局限性

  • 范围:仅涵盖九个面向消费者的服务;未考察企业层级和仅API使用场景。
  • 地理:测试从西班牙执行;可能存在地区差异。
  • 动态规避:部分SDK行为可能在未触发脚本交互条件下隐藏。
  • 服务器端不透明:无法完全观察不体现在网络流量中的后端数据流。

结论

本研究证明,主流对话式AI平台继承了网页和移动端的广告与追踪生态系统,并通过可与持久标识符关联的对话特异性数据加以扩展。这形成了一个新颖的隐私攻击面,与欧盟数据保护法相冲突,并破坏了用户对保密性的预期。必须采取更强的技术防护、透明披露和监管审查,以保护用户免于其最私人对话的无意暴露。

Sources

相关