對話式人工智慧服務將敏感資料外洩給廣告商 – 九個主要平台的隱私分析

關鍵發現

所有受調查的九項對話式人工智慧服務均在其網頁與行動客戶端中嵌入第三方廣告或追蹤服務(ATSes),且許多服務會將對話衍生的內容(如標題、提示、截圖與永久連結)與持久性使用者識別碼一同傳輸,創造出新的隱私風險。


測量範圍

  • 受檢測服務:ChatGPT、Claude、Gemini、Grok、DeepSeek、Perplexity、Copilot、Mistral 與 Meta AI。
  • 客戶端:所有九項服務的網頁前端,以及八項服務的 Android 應用程式(不包含 DeepSeek 移動版)。
  • 方法論:結合靜態反組譯(Androguard)與動態儀器化(Chrome DevTools、儀器化 Pixel 3a、mitmproxy、Frida),以捕捉網路流量、儲存寫入與 SDK 使用情況。
  • 實驗矩陣:在 Cookie 同意選擇(忽略、拒絕全部、接受全部)、訂閱等級(訪客、免費、付費)與隱私模式(若可用則為無痕模式)下進行測試。
  • 資料:18 頁 PDF、44 個第三方組織、124 個不同網域、44 個 ATSes,以及責任揭露日誌。

第三方追蹤生態

  • 普遍存在:每項服務皆會連線至少一個 ATS;平均每項服務有 44 個不同的第三方網域。
  • 主導業者:Google 產品(廣告、Tag Manager、Analytics、Firebase)出現在 9/9 項服務中;其他常見合作夥伴包括 Meta Pixel、TikTok Analytics、Sentry、Datadog 與 Intercom。
  • 網頁 vs. 行動:11 個 ATS 同時出現在兩個平台,15 個僅出現在網頁(例如 OneTrust、TikTok),8 個僅出現在行動裝置(例如 Braze)。行動裝置流量有 71 % 為 WebView 驅動,強化了應用程式內的網頁風格追蹤。

對話衍生內容外洩

內容 網頁外洩(服務數) 行動外洩(服務數)
對話 URL / 永久連結 5/9 0
對話 ID(不含完整 URL) 2/9 1/8
使用者提示 1/9 1/8
對話標題(AI 生成摘要) 3/9 0
截圖(共用畫面) 1/9 0
共用對話 URL 5/9 0
共用對話 ID 0 1/8
  • 機制:URL 與標題以查詢參數或 JSON 欄位形式傳送至 Google Ads、Meta Pixel、TikTok 與 Datadog 等追蹤工具。
  • 同意影響:接受非必要 Cookie 會啟用額外追蹤器(例如 Meta、TikTok、DoubleClick)。拒絕 Cookie 仍使 44 % 的服務傳輸資料給第三方。
  • 訂閱等級影響:免費與付費等級差異微小;僅 Claude 的行動客戶端在高階訂閱中移除 Intercom/Sentry。

將內容與持久識別碼連結

  • 觀察到的識別碼:雜湊電子郵件地址(HEMs)、帳戶使用者名稱、供應商特定 ID、Android 廣告 ID(AAID),以及 _fbp(Meta)與 _ttp(TikTok)等 Cookie。
  • 跨連結:追蹤工具同時接收對話內容與識別碼,使其能將聊天內容與跨裝置與服務的長期使用者檔案串接起來。
  • 伺服器端轉送:Claude 使用 Segment Analytics 將事件伺服器對伺服器轉送至十一個廣告網路,繞過廣告攔截工具。
  • 僅限網頁 vs. 僅限行動:
    • 網頁追蹤工具接收標題與 URL;行動 SDK 主要接收 ID,少數案例中亦接收郵件雜湊值。
    • 基於 WebView 的行動流量,對相同提供者的外洩模式與網頁類似。

公開可存取的永久連結

  • 存取控制矩陣(訪客 / 免費 / 付費):
    • ChatGPT、Claude、Gemini、Copilot、Mistral:預設僅擁有者可存取(可選關閉)。
    • Grok:預設公開,可關閉;Perplexity:訪客等級永遠公開。
  • 含義:只要擁有永久連結,任何人都可在未經身分驗證的情況下取得完整對話,暴露可能敏感的健康、財務或個人資料。

實際存取證據

  • 鯨魚令牌實驗:在提示與上傳文件中嵌入唯一 URL。
  • 結果:
    • Grok 在數天內觸發來自 14 個國家 48 個 AS 的 70 次不同存取(65 % 來自美國)。
    • Perplexity、Copilot、Mistral 與 Claude 均顯示來自雲端服務提供商的單次存取。
  • 解釋:第三方積極存取共用對話資源,確認此外洩非僅理論可能性。

法律評估(歐盟 GDPR 與 ePrivacy)

  • ePrivacy 指令:第 5(3) 條要求對 Cookie、追蹤像素與基於 URL 的追蹤事先取得明確同意。許多服務即使在使用者拒絕非必要 Cookie 時仍傳輸追蹤資料,違反此規定。
  • GDPR:處理對話內容與識別碼構成個人資料。提供者通常缺乏透明披露,且合法基礎僅限「履行合約」。歐洲法院(Meta Platforms Ireland)要求明確告知資料類別、目的與法律基礎——許多服務未能符合此要求。
  • 特殊類別資料風險:研究中使用的健康相關提示可能觸發 GDPR 特殊類別資料處理,但未見明顯保障措施。

影響討論

  • 隱私風險放大:對話式人工智慧為現有的廣告科技生態系統新增豐富且具意圖的資料(標題、提示),使細粒度的使用者輪廓建模成為可能。
  • 使用者控制無效:Cookie 同意橫幅與分層訂閱提供有限緩解;拒絕 Cookie 後仍有 80 % 的追蹤器保持活躍。
  • 更廣泛生態系:發現很可能延伸至自訂聊天機器人、LLM 驅動的網頁元件與企業級代理,因其使用相同的 SDK。
  • 濫用潛力:公開永久連結結合追蹤器存取,可能被武器化用於目標式釣魚、勒索或監視。

缓解建議

  1. 預設拒絕分享:提供者應預設將對話永久連結設定為私密,並要求使用者明確操作才產生可分享連結。
  2. 傳輸前清除內容:在傳送至第三方 ATS 的資料中移除標題、提示與 URL,除非使用者明確同意。
  3. 分離廣告科技與 AI 流程:部署專用廣告科技容器,不接收 AI 生成內容。
  4. 強化同意使用者介面:實施細粒度、無預先勾選框的同意對話,除非獲得接受,否則阻擋所有非必要追蹤器。
  5. 監管審查:資料保護機關應根據 GDPR/ePrivacy 要求審查已揭露的資料流,特別是針對健康相關提示。
  6. 使用者端工具:鼓勵使用注重隱私的瀏覽器(Brave、Tor)與行動隱私儀表板;考慮沙盒化 AI 代理(例如 cellmate)以限制 SDK 權限。

社群反應(Hacker News 精選)

"多個提供者將敏感的對話衍生內容——包括標題、提示與截圖——傳給第三方,通常還附帶可讓使用者歸因的持久性識別碼。我們也發現部分提供者公開暴露對話永久連結,沒有存取控制,讓追蹤器可以讀取整個對話。" – Coeur

"如果這是商業模式,那就不是外洩。" – drywater2(指出資料出售是故意行為,而非意外外洩。)

"廣告科技花了 20 年試圖從點擊串流推斷意圖。現在聊天應用直接送上由 AI 撰寫的一行意圖摘要,並以 Cookie 標記與鍵結。" – vivekpolavarapu(強調輪廓建模的新細緻程度。)

"我自行建了一個聊天介面來避免這問題。" – 0xcrypto(建議自托管替代方案。)


局限性

  • 範圍:僅涵蓋九項面向消費者的服務;企業級版本與僅 API 使用未納入檢測。
  • 地理:測試於西班牙執行;區域差異可能存在。
  • 動態逃避:部分 SDK 行為可能在未觸發腳本互動條件下隱藏。
  • 伺服器端不透明:無法完全觀測不顯現在網路流量中的後端資料流程。

結論

本研究顯示,主流對話式人工智慧平台繼承了網頁與行動裝置的廣告與追蹤生態系統,並擴展其功能,加入可與持久識別碼連結的對話特定資料。這創造出一種新型隱私攻擊面,與歐盟資料保護法衝突,並破壞使用者對保密性的期望。加強技術防護、透明披露與監管審查,對於保護使用者免於無意間暴露最私人對話至關重要。

Sources

相關