Perplexity AI 그라운딩 분석: 조작된 출처와 AI 생성 구매 가이드
AI 검색 시스템이 낮은 권한의 도메인에 근거한 추천을 제공함
웹 기반 AI 모델에 대한 연구에 따르면 제품 추천 시 낮은 권한과 기계 생성 콘텐츠에 크게 의존하는 것으로 나타났습니다. perplexity/sonar 및 perplexity/sonar-pro를 사용하여 380개의 소프트웨어 카테고리를 테스트한 결과, 7,534개의 인용 중 83.2%가 Tranco top-1M 목록에서 #100,000위보다 낮거나 상위 100만 위권에 아예 포함되지 않은 도메인을 가리켰습니다.
인용 권한 분포
Perplexity 모델의 검색 레이어는 높은 권한을 가진 사이트 간의 집중도가 현저히 낮음을 보여줍니다. 가장 많이 인용된 상위 10개 도메인이 전체 인용의 17.3%를 차지하지만, 나머지 5분의 4의 증거 기반은 롱테일 출처로 구성되어 있습니다. 구체적으로, 인용된 도메인의 36.5%는 Tranco 상위 100만 목록에 나타나지 않습니다. 이러한 순위 미등록 도메인은 훨씬 최근에 생성되었으며, 순위가 있는 도메인의 첫 Wayback Machine 캡처 연도가 2011년인 반면, 이들의 중앙값은 2020년입니다.
| 도메인 | 인용 수 | 비율 | Tranco 순위 |
|---|---|---|---|
| g2.com | 291 | 3.86% | 4,027 |
| reddit.com | 261 | 3.46% | 105 |
| guideflow.com | 194 | 2.57% | 177,039 |
| gartner.com | 158 | 2.10% | 1,766 |
| zapier.com | 82 | 1.09% | 2,919 |
AI SEO를 위한 "그라운딩 페이지"의 부상
wifitalents.com, worldmetrics.org, gitnux.org라는 세 개의 도메인 네트워크는 AI 검색 시스템을 위해 특별히 설계된 조작된 콘텐츠의 주요 출처로 확인되었습니다. 이 사이트들은 모두 2023년 12월부터 2024년 5월 사이에 등록되었으며, 동일한 Cloudflare 네임서버, 페이지 템플릿 및 탐색 구조를 공유합니다.
기계 생성 콘텐츠의 규모
이들 세 사이트는 215,128개의 기계 생성 best <category> 페이지를 게시했습니다. 이 작업의 규모는 기존 소프트웨어 카테고리의 수를 훨씬 초과하며, AI 검색 트래픽을 캡처하기 위한 프로그래밍 방식의 접근법을 나타냅니다.
검색 레이어 표적화
인간 독자를 대상으로 하는 기존 SEO와 달리, 이 사이트들은 AI "그라운딩" 프로세스를 명시적으로 표적으로 삼습니다. worldmetrics.org와 gitnux.org는 "Facts & Grounding Page"와 같은 HTML 제목과 자신을 "확인된 사실의 기계 판독 가능 기록"이라고 설명하는 메타 설명을 사용합니다. 이는 콘텐츠가 LLM 검색 레이어에 의해 수집되도록 특별히 구조화되는 "AI 엔진 최적화"(AEO)로의 전환을 시사합니다.
AI 생성 추천의 모순
권위 있는 연구 기관으로 가장하고 있음에도 불구하고, 조작된 사이트 네트워크는 동일한 소프트웨어 카테고리에 대해 모순된 순위를 제공합니다. "project estimation software" 카테고리의 경우, 세 사이트는 동일한 템플릿을 사용하고 "AI 확인" 또는 "전문가 검토" 프로세스를 주장했음에도 불구하고 각각 다른 최상위 도구를 제공했습니다.
또한, 검색 프로세스는 환각 또는 위험한 링크로 이어질 수 있습니다. 모델이 제공한 1,502개의 벤더 홈페이지 샘플 연구에서 다음이 확인되었습니다:
- **1.1%**는 사라졌거나 접근할 수 없었습니다.
- **6.1%**는 다른 도메인으로 리디렉션되었습니다.
- 모델에 연구 데이터 플랫폼 및 데이터 품질 도구를 요청했을 때, 일부 인용은 인도네시아 온라인 도박 포털 및 모나코 호텔 카지노 그룹과 같은 무관한 사이트로 이어졌습니다.
커뮤니티 통찰 및 반론
기술 사용자들 간의 논의에 따르면 이 현상은 AI 생태계에서 "AI 쓰레기(AI slop)" 및 순환 논리의 더 광범위한 추세의 일부인 것으로 보입니다.
"이제 검색 엔진이 곧 인용이며, 인용은 인용되기 위해 존재하는 페이지입니다. 그 루프 안의 누구도 아무것도 읽지 않았지만, 여전히 작동합니다."
커뮤니티에서 제기된 주요 우려 사항은 다음과 같습니다:
- AI 콘텐츠에 대한 모델 선호: 일부 사용자는 LLM이 인간이 작성한 글보다 AI 생성 구절을 선호하는 경향이 있다고 보고하며, 이는 모델이 자신의 재생산물을 학습하고 인용하는 피드백 루프를 만들어냅니다.
- 출처에 대한 회의론 부재: 현재의 에이전트 워크플로우에는 "출처 회의론"이 부족하다고 인식됩니다. 모델이 게시된 정보의 동기를 고려하지 못해 "유료 검증" 시스템에 취약해집니다.
- 보고서의 진정성: 일부 HN 댓글 작성자들은 연구 자체의 진정성을 의심하며, 이 보고서가 설명하는 것과 동일한 AI 생성 콘텐츠 전략의 일부일 수 있다고 제안했습니다. 보고 사이트(
trellner.com)가 유사한 AI 생성 패턴을 따르는 것으로 보인다고 지적했습니다.
방법론 및 범위
이 연구는 OpenRouter를 통한 Perplexity AI의 sonar 및 sonar-pro 모델에만 중점을 두었습니다. 380개의 구매 의도 카테고리와 총 760회의 호출을 사용했습니다. 연구자들은 이 결과가 검색 인덱스의 스냅샷을 반영하며 ChatGPT, Gemini 또는 Copilot과 같은 다른 AI 검색 엔진의 성능을 반드시 대변하지는 않는다고 언급했습니다.
요약: Perplexity AI의 인용에 대한 연구에 따르면 소프트웨어 추천의 83.2%가 순위가 낮거나 순위가 없는 도메인에 근거하고 있으며, 여기에는 AI 검색을 위해 특별히 215,000개 이상의 기계 생성 '최고의 소프트웨어' 페이지를 만들어낸 세 사이트의 네트워크가 포함되어 있습니다.
제목: Perplexity AI 그라운딩 분석: 조작된 출처와 AI 생성 구매 가이드
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch