AI 훈련의 마찰: PostHog의 대담한 움직임과 커뮤니티 반발

PostHog는 최근 제품 전략에서 야심찬 변화를 발표했습니다: "능동적이고 자율 구동되는 제품"으로의 전환입니다. 이 비전은 단순한 분석을 넘어 PostHog Code와 같은 도구로 나아가는 것으로, 이는 답변과 솔루션을 자동으로 제공하여 팀이 더 나은 제품을 더 빠르게 구축하도록 돕는 제품 편집기입니다.

이를 달성하기 위해 PostHog는 고객 인스턴스의 데이터를 사용해 자체 AI 모델을 훈련시킬 계획입니다. 회사는 이를 제품을 더 똑똑하고 유용하게 만들기 위한 필수 단계라고 설명하지만, 이번 발표는 개발자 커뮤니티에서 큰 반발을 일으켰으며 AI 혁신과 사용자 동의 사이의 긴장이 커지고 있음을 보여줍니다.

비전: 능동적 분석 및 합성 테스트

PostHog의 목표는 방대한 사용자 행동 데이터를 활용해 반응형 분석에서 능동형 최적화로 전환하는 것입니다. 회사는 맞춤형 모델이 즉각적인 가치를 제공할 수 있는 세 가지 주요 영역을 확인했습니다:

  • Session Replay Analysis: PostHog AI가 이미 재생에서 문제를 감지할 수 있지만, 현재 과정은 비용이 많이 들고 확장하기 어렵습니다. 기본 재생 데이터를 기반으로 훈련된 모델은 수천 명의 사용자를 동시에 대상으로 문제 진단을 자동화할 수 있습니다.
  • Synthetic User Testing: PostHog는 사용자 행동에 대한 지식을 활용해 사용자가 혼란스러워 할 수 있는 지점이나 흐름이 끊길 수 있는 지점을 기능이 프로덕션에 배포되기 전에 예측하고자 하며, 이를 통해 수동 QA와 코드 리뷰의 부담을 줄일 수 있습니다.
  • Predictive Behavior Modeling: 사용자 행동을 예측함으로써 PostHog는 전환율을 높이고 기존 기능에 대한 사용자 불만을 줄이기 위한 구체적인 변경 사항을 제안하고자 합니다.

구현: 투명성 vs. 동의

PostHog는 전형적인 "약관에 숨겨진" 접근 방식을 피하고 롤아웃에 대해 투명하려고 노력했습니다. 데이터 사용에 관한 구체적인 규칙을 다음과 같이 제시했습니다:

  1. EU Cloud Users: 규제 요구사항으로 인해 기본적으로 옵트아웃됩니다.
  2. Contractual Protections: BAA, MSA 등 유사 계약을 가진 사용자는 기본적으로 옵트아웃됩니다.
  3. US Cloud Users: 기본적으로 옵트인됩니다.
  4. Anonymization: 모든 데이터는 훈련 전에 익명화될 것이라고 약속합니다.
  5. Internal Training: PostHog는 직접 훈련을 수행하며, 데이터를 제3자 모델 제공업체에 판매하거나 전송하지 않을 것을 약속합니다.

커뮤니티 반응: "Opt-in by Default"

발표의 투명성에도 불구하고 Hacker News와 같은 플랫폼에서의 반응은 압도적으로 부정적이었습니다. 논란의 핵심은 미국 기반 고객에 대한 정책이 "옵트아웃" 형태라는 점에 있습니다.

비평가들은 "Opt-in by Default"가 모순된 표현이라고 주장합니다. 많은 사용자는 특히 자체 코드와 밀접하게 연결된 텔레메트리 데이터를 사용하는 데이터 훈련 프로그램에 자동으로 등록되는 것이 신뢰를 심각하게 위배한다고 표현했습니다.

"그들의 데이터를 얻는 유일한 방법은 당신이 데이터를 가져갈 수 있다고 가정하고 그들에게 중단을 요구하도록 강제하는 것입니다. 그게 무슨 의미일지 궁금합니다."

정책 자체를 넘어, 사용자들은 "익명화" 정의에 대해 우려를 표했습니다. PostHog가 민감한 로그인 데이터를 접근할 수 있는 상황에서, 개발자들은 민감한 정보가 훈련 세트에 유출되지 않도록 어떤 정제 과정이 적용되는지 정확히 묻고 있습니다.

브랜드 역설

또 다른 논쟁점은 PostHog의 공개 브랜드 이미지와 이번 비즈니스 결정 사이의 불일치입니다. PostHog는 "no-BS", 독특하고 투명한 이미지를 구축해 왔습니다. 그러나 많은 사용자는 옵트아웃 데이터 정책이 그 이미지와 모순되는 "슬리미"한 움직임이라고 느낍니다.

"그들이 자신을 비슬리하고 no-BS인 사람들로 포지셔닝하려면, 이런 nonsense를 끌어올 수 없습니다."

결론: 데이터 갈망의 비용

PostHog의 딜레마는 AI 시대의 고전적인 문제입니다: 유용한 모델을 만들기 위한 고품질, 독점 데이터에 대한 갈망. 회사는 옵트아웃 정책이 없으면 모델을 효과적으로 만들 충분한 데이터를 확보할 수 없다고 인정했습니다.

하지만 커뮤니티의 반응은 많은 개발자에게 데이터 획득 비용(사용자 신뢰와 고객 이탈로 측정)이 구축 중인 AI 기능의 잠재적 가치보다 클 수 있음을 시사합니다. 사용자가 자체 호스팅 솔루션이나 대체 분석 제공업체로 이동함에 따라, 이번 사건은 현대 개발자 생태계에서 동의가 편리함보다 더 가치 있게 여겨진다는 점을 상기시켜 줍니다.

Sources