会話型AIサービスが広告業者に機密データを漏洩 – 9大プラットフォームのプライバシー分析
主な発見
9つの調査対象会話型AIサービスすべてが、Webおよびモバイルクライアントに第三者広告・トラッキングサービス(ATSes)を埋め込んでおり、多くの場合、会話から得られるアーティファクト(タイトル、プロンプト、スクリーンショット、永続的なURLなど)と永続的なユーザー識別子を一緒に送信している。これにより、新たなプライバシーリスクが生じている。
測定の範囲
- 調査対象サービス: ChatGPT、Claude、Gemini、Grok、DeepSeek、Perplexity、Copilot、Mistral、Meta AI。
- クライアント: 9サービスすべてのWebフロントエンドと、8サービス(DeepSeekモバイルを除く)のAndroidアプリ。
- 手法: 静的逆コンパイル(Androguard)と動的インストルメンテーション(Chrome DevTools、インストルメント付きPixel 3a、mitmproxy、Frida)を組み合わせ、ネットワークトラフィック、ストレージ書き込み、SDK使用状況を収集。
- 実験マトリクス: クッキー同意設定(無視、すべて拒否、すべて許可)、サブスクリプション層(ゲスト、無料、有料)、プライバシーモード(利用可能な場合)を対象にテスト。
- データ: 18ページのPDF、44の第三者組織、124の固有ドメイン、44のATSes、および責任ある開示ログ。
第三者トラッキングの状況
- 普遍性: すべてのサービスが少なくとも1つのATSに接続しており、平均して1サービスあたり44の固有第三者ドメインが利用されている。
- 主要プレイヤー: Google製品(Ads、Tag Manager、Analytics、Firebase)は9/9のサービスに登場。その他の頻出パートナーにはMeta Pixel、TikTok Analytics、Sentry、Datadog、Intercomがある。
- Web vs. モバイル: 11のATSが両プラットフォームに存在、15はWebのみ(例:OneTrust、TikTok)、8はモバイルのみ(例:Braze)。モバイルトラフィックの71 %はWebView駆動であり、アプリ内でもWebスタイルのトラッキングが拡大している。
会話由来アーティファクトの漏洩
| アーティファクト | Web漏洩(サービス数) | モバイル漏洩(サービス数) |
|---|---|---|
| 会話URL / パーマリンク | 5/9 | 0 |
| 会話ID(完全URLなし) | 2/9 | 1/8 |
| ユーザープロンプト | 1/9 | 1/8 |
| 会話タイトル(AI生成要約) | 3/9 | 0 |
| スクリーンショット(共有ビュー) | 1/9 | 0 |
| 共有会話URL | 5/9 | 0 |
| 共有会話ID | 0 | 1/8 |
- メカニズム: URLやタイトルは、Google Ads、Meta Pixel、TikTok、DatadogなどのトラッカーにクエリパラメータまたはJSONフィールドとして送信される。
- 同意の影響: 非必須クッキーの許可により、追加のトラッカー(例:Meta、TikTok、DoubleClick)が有効化される。クッキーの拒否でも、44 %のサービスが第三者にデータを送信している。
- サブスクリプション層の影響: 無料と有料の差は顕著でない。Claudeのモバイルクライアントのみ、プレミアム層でIntercom/Sentryが削除される。
アーティファクトと永続識別子のリンク
- 観察された識別子: ハッシュ化されたメールアドレス(HEMs)、アカウントユーザー名、プロバイダ固有ID、Android広告ID(AAID)、および
_fbp(Meta)や_ttp(TikTok)などのクッキー。 - クロスリンク: トラッカーは会話アーティファクトと識別子の両方を受け取り、これにより複数デバイス・複数サービス間でチャット内容を長期ユーザープロファイルに紐づけることが可能になる。
- サーバーサイド転送: ClaudeはSegment Analyticsを使用して、イベントを11の広告ネットワークにサーバー間で転送しており、広告ブロッカーを回避している。
- Web専用 vs. モバイル専用:
- WebトラッカーはタイトルとURLを受け取るが、モバイルSDKは主にIDを受け取り、一部ではメールハッシュも受信。
- WebViewベースのモバイルトラフィックは、同じプロバイダに対してWeb漏洩パターンを再現している。
公開可能なパーマリンク
- アクセス制御マトリクス(ゲスト / 無料 / 有料):
- ChatGPT、Claude、Gemini、Copilot、Mistral: デフォルトで所有者専用(オプションでオプトアウト可能)。
- Grok: デフォルトで公開(オプトアウト可能);Perplexity: ゲスト層では常に公開。
- 意味: パーマリンクを所持する誰でも認証なしで完全な会話を取得可能であり、健康、金融、個人に関する機密データが暴露されるリスクがある。
実世界でのリトリーブ証拠
- カニー・トークン実験: プロンプトおよびアップロードされたドキュメントに一意のURLを埋め込み、アクセスを監視。
- 結果:
- Grokは、14カ国から48のAS(自治システム)にわたり、数日間で70回の異なるアクセスを引き起こした(うち65 %が米国から)。
- Perplexity、Copilot、Mistral、Claudeはクラウドプロバイダからの単発アクセスを示した。
- 解釈: 第三者が共有会話リソースを積極的にリトリーブしており、漏洩が単なる理論的リスクではないことを確認している。
法的評価(EU GDPRおよびePrivacy)
- ePrivacy指令: 第5条第3項では、クッキー、トラッキングピクセル、URLベースのトラッキングに対して事前の同意が必要。多くのサービスは、ユーザーが非必須クッキーを拒否してもトラッキングデータを送信しており、この要件に違反している。
- GDPR: 会話コンテンツおよび識別子の処理は個人データに該当する。多くのサービスは透明性のない開示と、「契約の履行」以外の法的根拠を欠いている。CJEU(Meta Platforms Ireland)は、データの種類、目的、法的根拠について明示的な情報開示を義務づけているが、多くのサービスはこれを満たしていない。
- 特別カテゴリデータのリスク: 本研究で使用された健康関連のプロンプトは、GDPRの特別カテゴリ処理を引き起こす可能性があるが、明示的な保護策は確認されていない。
影響に関する議論
- プライバシーリスクの拡大: 会話型AIは、既存の広告テックエコシステムに、タイトルやプロンプトといった意図を含む豊富なデータを追加し、より細粒度なプロファイリングを可能にする。
- ユーザー制御の無効性: クッキー同意バナーとサブスクリプション層の分離は限定的な対策にとどまり、クッキー拒否後も80 %のトラッカーがアクティブなまま。
- より広範なエコシステム: 結果は、カスタムチャットボット、LLM駆動のWebウィジェット、エンタープライズグレードのエージェントなど、同じSDKを再利用するサービスにも拡張可能。
- 悪用の可能性: 公開されたパーマリンクとトラッカーへのアクセスを組み合わせることで、標的型フィッシング、脅迫、監視などに悪用されるリスクがある。
対策の推奨事項
- デフォルト拒否共有: プロバイダは会話パーマリンクをデフォルトで非公開とし、共有リンクを生成するには明示的なユーザー操作を必要とするべき。
- 送信前にアーティファクトを除去: ユーザーが明示的にオプトインしない限り、第三者ATSに送信するペイロードからタイトル、プロンプト、URLを削除すべき。
- 広告テックとAIパイプラインの分離: AI生成コンテンツを受け取らない専用の広告テックコンテナを導入すべき。
- 同意UIの強化: 非必須トラッカーをブロックする、細分化された、事前チェックのない同意ダイアログを実装すべき。
- 規制監視: データ保護当局は、GDPR/ePrivacy要件に照らして開示されたデータフローを監査すべき。特に健康関連のプロンプトに対して。
- ユーザー側ツール: プライバシー重視のブラウザ(Brave、Tor)やモバイルプライバシーダッシュボードの利用を促進すべき。AIエージェントのサンドボックス化(例:cellmate)を検討し、SDK権限を制限すべき。
コミュニティの反応(Hacker Newsハイライト)
"複数のプロバイダが、タイトル、プロンプト、スクリーンショットなど、機密性の高い会話由来アーティファクトを第三者に開示しており、多くの場合、ユーザーの属性付けを可能にする永続的な識別子とともに送信されている。また、一部のプロバイダは、アクセス制御なしに会話パーマリンクを公開しており、トラッカーが完全な会話を読み取れる状態になっている。" – Coeur
"漏洩ではない。それがビジネスモデルなのだ。" – drywater2(意図的なデータ販売を指摘)
"広告テックは20年間、クリックストリームから意図を推測しようと努力してきた。チャットアプリは、AIが書いた意図の1行要約を、クッキーにラベル付け・キーワード化された形で提供している。" – vivekpolavarapu(プロファイリングの新たな粒度を強調)
"私はこれを回避するために自前のチャットインターフェースを構築した。" – 0xcrypto(セルフホスティングの代替案を提案)
限界
- 範囲: 9つの消費者向けサービスのみを対象としており、エンタープライズ層やAPI専用利用は調査対象外。
- 地理: スペインからテスト実施。地域差が存在する可能性がある。
- 動的回避: スクリプト化された相互作用でトリガーされない条件下では、SDKの挙動が隠蔽されている可能性がある。
- サーバーサイドの不透明性: ネットワークトラフィックに現れないバックエンドデータフローは完全に観測できない。
結論
本研究は、主流の会話型AIプラットフォームがWebおよびモバイルの広告・トラッキングエコシステムを引き継ぎ、それらに会話固有のデータを追加していることを示している。これらのデータは永続識別子とリンク可能であり、EUのデータ保護法とユーザーの機密性への期待に反する、新たなプライバシー攻撃表面を生み出している。ユーザーが最も個人的な会話を不意に暴露するリスクを防ぐためには、強固な技術的対策、透明な開示、そして規制監視が不可欠である。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch