대화형 AI 서비스가 광고주에게 민감한 데이터 유출 – 9대 주요 플랫폼의 개인정보 분석
핵심 발견
모든 조사된 9개 대화형 AI 서비스는 웹 및 모바일 클라이언트에 제3자 광고 또는 추적 서비스(ATSes)를 포함하고 있으며, 많은 경우 대화에서 유도된 자산(예: 제목, 프롬프트, 스크린샷, 고정 URL)과 지속적인 사용자 식별자를 함께 전송하여 새로운 개인정보 위험을 초래한다.
측정 범위
- 조사 대상 서비스: ChatGPT, Claude, Gemini, Grok, DeepSeek, Perplexity, Copilot, Mistral, Meta AI.
- 클라이언트: 9개 서비스의 웹 프론트엔드와 8개 서비스의 Android 앱(DeepSeek 모바일 제외).
- 방법론: 정적 디컴파일링(Androguard)과 동적 인스트루먼테이션(Chrome DevTools, 인스트루먼티드 Pixel 3a, mitmproxy, Frida)을 결합하여 네트워크 트래픽, 저장소 기록, SDK 사용을 캡처.
- 실험 매트릭스: 쿠키 동의 선택(무시, 모든 거부, 모든 수락), 구독 등급(게스트, 무료, 유료), 개인정보 보호 모드(사용 가능한 경우 인코그니토)를 기반으로 테스트.
- 데이터: 18페이지 PDF, 44개 제3자 조직, 124개 별도 도메인, 44개 ATS, 책임 있는 공개 로그 포함.
제3자 추적 환경
- 보편적 존재: 모든 서비스가 최소 1개 이상의 ATS에 접속; 평균적으로 각 서비스당 44개의 별도 제3자 도메인.
- 주도적 플레이어: Google 제품(Ads, Tag Manager, Analytics, Firebase)은 9/9 서비스에 나타남; 기타 자주 등장하는 파트너로는 Meta Pixel, TikTok Analytics, Sentry, Datadog, Intercom.
- 웹 vs. 모바일: 11개 ATS는 두 플랫폼 모두에 존재, 15개는 웹 전용(예: OneTrust, TikTok), 8개는 모바일 전용(예: Braze). 모바일 트래픽의 71%는 WebView 기반으로, 앱 내에서 웹 스타일 추적이 강화된다.
대화에서 유도된 자산의 유출
| 자산 | 웹 유출 (서비스 수) | 모바일 유출 (서비스 수) |
|---|---|---|
| 대화 URL / 고정 링크 | 5/9 | 0 |
| 대화 ID (전체 URL 없음) | 2/9 | 1/8 |
| 사용자 프롬프트 | 1/9 | 1/8 |
| 대화 제목 (AI 생성 요약) | 3/9 | 0 |
| 스크린샷 (공유 보기) | 1/9 | 0 |
| 공유된 대화 URL | 5/9 | 0 |
| 공유된 대화 ID | 0 | 1/8 |
- 기작: URL과 제목은 Google Ads, Meta Pixel, TikTok, Datadog 등의 추적기로 쿼리 매개변수나 JSON 필드 형태로 전송됨.
- 동의 영향: 비필수 쿠키 수락 시 추가 추적기 활성화(예: Meta, TikTok, DoubleClick). 쿠키 거부에도 불구하고 44%의 서비스가 제3자에게 데이터 전송.
- 구독 등급 영향: 무료 vs. 유료 등급 간 차이 거의 없음; 단, Claude의 모바일 클라이언트만 프리미엄 등급에서 Intercom/Sentry 비활성화.
자산을 지속적 식별자와 연결하기
- 관찰된 식별자: 해시 처리된 이메일 주소(HEMs), 계정 사용자명, 제공업체 고유 ID, Android 광고 ID(AAID),
_fbp(Meta) 및_ttp(TikTok) 같은 쿠키. - 크로스링킹: 추적기가 대화 자산과 식별자를 동시에 수신하여, 장기간 사용자 프로파일을 여러 기기 및 서비스 간 연결할 수 있음.
- 서버 사이드 포워딩: Claude는 Segment Analytics를 통해 이벤트를 서버 간 전달하여 11개 광고 네트워크에 전달하며, 광고 차단기 회피.
- 웹 전용 vs. 모바일 전용:
- 웹 추적기는 제목과 URL 수신; 모바일 SDK는 주로 ID 수신, 일부 경우 이메일 해시 수신.
- WebView 기반 모바일 트래픽은 동일 제공업체에 대해 웹 유출 패턴을 반영.
공개 접근 가능한 고정 링크
- 접근 제어 매트릭스 (게스트 / 무료 / 유료):
- ChatGPT, Claude, Gemini, Copilot, Mistral: 기본적으로 소유자 전용(옵션으로 비활성화 가능).
- Grok: 기본적으로 공개(비활성화 옵션 있음); Perplexity: 게스트 등급에서는 항상 공개.
- 의미: 고정 링크를 가진 누구라도 인증 없이 전체 대화를 검색할 수 있어, 건강, 재정, 개인 정보 등 민감한 데이터 노출 위험 있음.
실제 리트리ieval 증거
- 캔리 토큰 실험: 프롬프트와 업로드 문서에 고유 URL 삽입.
- 결과:
- Grok는 14개 국가에서 48개 AS로부터 70건의 별도 접근을 하루 동안 기록(65% 미국에서 발생).
- Perplexity, Copilot, Mistral, Claude는 클라우드 제공업체에서 단일 접근 기록.
- 해석: 제3자가 공유된 대화 리소스를 적극적으로 검색함으로써, 유출이 순수 이론이 아님을 확인.
법적 평가 (EU GDPR 및 ePrivacy)
- ePrivacy 지침: 제5조(3)항은 쿠키, 추적 픽셀, URL 기반 추적에 대한 사전 동의 필요 요구. 사용자가 비필수 쿠키를 거부했음에도 불구하고 많은 서비스가 추적 데이터를 전송하여 이 규정 위반.
- GDPR: 대화 내용과 식별자의 처리는 개인 정보에 해당. 제공업체 대부분은 투명한 공개 부족, 계약 이행 외 법적 근거 없음. CJEU(Meta Platforms Ireland)는 데이터 카테고리, 목적, 법적 근거에 대한 명확한 정보 제공을 요구하지만, 많은 서비스는 이를 충족하지 못함.
- 특수 카테고리 데이터 위험: 본 연구에서 사용된 건강 관련 프롬프트는 GDPR 특수 카테고리 처리를 유발할 수 있으나, 명시적 보호 조치는 확인되지 않음.
영향 논의
- 개인정보 위험 증폭: 대화형 AI는 기존 광고 기술 생태계에 의도를 담은 풍부한 데이터(제목, 프롬프트)를 추가하여 더 세밀한 프로파일링 가능하게 함.
- 사용자 통제의 무력화: 쿠키 동의 배너와 등급 기반 구독은 제한적인 완화 효과; 쿠키 거부 후에도 80%의 추적기가 여전히 활성화됨.
- 더 넓은 생태계: 발견 결과는 동일 SDK를 재사용하는 커스텀 챗봇, LLM 기반 웹 위젯, 기업용 에이전트에도 확장될 가능성 있음.
- 악용 가능성: 공개 고정 링크와 추적기 접근이 결합되면 표적 피싱, 협박, 감시 등에 악용될 수 있음.
완화 권고사항
- 기본 거부 공유: 제공업체는 대화 고정 링크를 기본적으로 비공개로 하고, 공유 가능한 링크 생성을 사용자 명시적 동의로 요구해야 함.
- 전송 전 자산 제거: 사용자가 명시적으로 동의하지 않는 한, 제3자 ATS에 전송되는 페이로드에서 제목, 프롬프트, URL 제거.
- 광고 기술과 AI 파이프라인 분리: AI 생성 콘텐츠를 받지 않는 전용 광고 기술 컨테이너 배포.
- 동의 UI 강화: 모든 비필수 추적기를 차단하는 세밀하고 사전 체크 박스 없는 동의 다이얼로그 도입.
- 규제 감시: 개인정보 보호 당국이 공개된 데이터 흐름을 GDPR/ePrivacy 요건에 따라 감사해야 하며, 특히 건강 관련 프롬프트에 대해 집중 감시 필요.
- 사용자 측 도구: 개인정보 중심 브라우저(예: Brave, Tor) 및 모바일 개인정보 대시보드 사용 권장; AI 에이전트의 샌드박싱(예: cellmate) 고려하여 SDK 권한 제한.
커뮤니티 반응 (Hacker News 요약)
"여러 제공업체가 민감한 대화에서 유도된 자산(제목, 프롬프트, 스크린샷)을 제3자에게 공개하며, 종종 사용자 추적을 가능하게 하는 지속적 식별자와 함께 전송합니다. 또한 일부 제공업체는 접근 제어 없이 대화 고정 링크를 공개적으로 노출하여 추적기가 전체 대화를 읽을 수 있게 합니다." – Coeur
"유출이라기보다는 사업 모델입니다." – drywater2 (의도적인 데이터 판매를 지적함)
"광고 기술은 20년간 클릭스트림에서 의도를 추론하려 노력했습니다. 이제 챗 앱은 사용자의 의도를 한 줄 요약한 AI 작성물, 쿠키에 레이블링되어 키워드로 연결된 자료를 제공합니다." – vivekpolavarapu (프로파일링의 새로운 세밀도 강조)
"나는 이를 피하기 위해 자체 챗 인터페이스를 만들었습니다." – 0xcrypto (자체 호스팅 대안 제안)
제한점
- 범위: 9개 소비자 대상 서비스만 조사; 기업 등급 및 API 전용 사용은 조사 대상 아님.
- 지역성: 스페인에서 테스트 수행; 지역적 차이 존재 가능성 있음.
- 동적 회피: 일부 SDK 동작은 스크립트 상호작용에서 발생하지 않은 조건에서 숨겨져 있을 수 있음.
- 서버 사이드 불투명성: 네트워크 트래픽에 나타나지 않는 백엔드 데이터 흐름은 완전히 관찰 불가.
결론
본 연구는 주류 대화형 AI 플랫폼이 웹 및 모바일의 광고 및 추적 생태계를 계승하면서, 지속적 식별자와 연결 가능한 대화 특화 데이터를 추가함을 입증했다. 이는 EU 개인정보 보호법과 사용자의 기밀성 기대에 위배되는 새로운 개인정보 공격 표면을 창출한다. 사용자가 가장 개인적인 대화를 실수로 노출하는 것을 방지하기 위해 강력한 기술적 보호 장치, 투명한 공개, 규제 감시가 필수적이다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch