Perplexity AIの根拠分析:捏造された情報源とAI生成の購入ガイド
AI検索システムは低権威ドメインに根拠を置く傾向がある
Webに基づくAIモデルに関する研究では、製品推薦に低権威および機械生成コンテンツに大きく依存していることが明らかになった。perplexity/sonar および perplexity/sonar-pro を用いた380種類のソフトウェアカテゴリに対するテストにおいて、7,534件の引用のうち83.2%がTranco top-1Mリストで100,000位より低い順位、またはトップ100万にランクインしていないドメインを指していた。
引用の権威分布
Perplexityのモデルにおける検索レイヤーは、高権威サイトに集中しているとは言えない。上位10の引用ドメインが全体の17.3%を占める一方、残りの4分の3は長尾の情報源で構成されている。特に、引用されたドメインの36.5%はTrancoトップ100万に含まれていない。これらのランク外ドメインは、ランクインドメインと比べて著しく新しいもので、Wayback Machineでの最初のキャプチャの中央値は2020年であるのに対し、ランクインドメインは2011年である。
| ドメイン | 引用数 | 比率 | Tranco順位 |
|---|---|---|---|
| g2.com | 291 | 3.86% | 4,027 |
| reddit.com | 261 | 3.46% | 105 |
| guideflow.com | 194 | 2.57% | 177,039 |
| gartner.com | 158 | 2.10% | 1,766 |
| zapier.com | 82 | 1.09% | 2,919 |
AI SEO向け「根拠ページ」の台頭
wifitalents.com、worldmetrics.org、gitnux.org の3つのドメインからなるネットワークが、AI検索システム専用に設計された捏造コンテンツの主要な供給源として特定された。これらのサイトはいずれも2023年12月から2024年5月の間に登録されており、同一のCloudflare名前サーバー、ページテンプレート、ナビゲーション構造を共有している。
機械生成コンテンツの規模
これらの3サイトが合計で215,128件の機械生成されたbest <カテゴリ>ページを公開した。この規模は既存のソフトウェアカテゴリ数をはるかに上回っており、AI検索トラフィックを収集するためのプログラム的アプローチであることを示している。
検索レイヤーへのターゲティング
従来のSEOが人間読者をターゲットとするのに対し、これらのサイトは明確にAIの「根拠付け(grounding)」プロセスをターゲットにしている。worldmetrics.org および gitnux.org は「Facts & Grounding Page」といったHTMLタイトルや、「検証済みの事実の機械可読記録」と説明するメタディスクリプションを使用している。これは、LLMの検索レイヤーに取り込まれるようにコンテンツを構造化する「AIエンジン最適化(AEO)」へのシフトを示唆している。
AI生成推薦の不整合性
権威ある調査機関を装うこのネットワークは、同じソフトウェアカテゴリに対して矛盾するランキングを提供している。たとえば「プロジェクト見積もりソフトウェア」というカテゴリでは、3サイトがそれぞれ異なるトップツールを挙げており、同じテンプレートを使用し、「AI検証済み」または「専門家レビュー済み」と主張しているにもかかわらず、一致しない。
さらに、検索プロセスは幻覚的または危険なリンクを引き起こす可能性がある。モデルが提供した1,502件のベンダー公式ページのサンプルにおいて:
- 1.1% は削除済みまたはアクセス不可能だった。
- 6.1% は異なるドメインにリダイレクトされた。
- モデルが「研究データプラットフォーム」や「データ品質ツール」について尋ねた際、関連のないサイト、たとえばインドネシアのオンラインカジノポータルやモナコのホテル・カジノグループにリダイレクトされた例もあった。
コミュニティの洞察と反論
技術者コミュニティの議論では、この現象はAIエコシステムにおける「AIスロップ(AI slop)」や循環的推論の広範な傾向の一部であると指摘されている。
"検索エンジンが今や引用であり、引用は引用されるために存在するページである。そのループの中で誰も何も読んだことはないが、それでも機能している。"
コミュニティが提起した主な懸念点は以下の通り:
- モデルがAIコンテンツを好む傾向:一部のユーザーは、LLMが人間が書いた文章よりもAI生成の文章を好む傾向があると報告しており、モデルが自らの再現物を学習・引用するフィードバックループを生み出している。
- 情報源に対する懐疑心の欠如:現在のエージェントワークフローには「情報源に対する懐疑心」が欠けており、発信者の意図を考慮しないため、「支払いによる承認」システムに脆弱である。
- 報告の信憑性:一部のHNコメントでは、この研究自体の信憑性に疑問を呈しており、報告が記述しているAI生成コンテンツ戦略そのものに含まれている可能性を指摘。報告サイト(
trellner.com)が同様のAI生成パターンに従っていると指摘された。
方法論と範囲
本研究は、OpenRouter経由でPerplexity AIのsonarおよびsonar-proモデルに限定して実施された。380の購入意図カテゴリと760回の総呼び出しを用いた。研究者は、結果は検索インデックスのスナップショットに過ぎず、ChatGPT、Gemini、Copilotなどの他のAI検索エンジンのパフォーマンスを必ずしも反映するものではないと指摘している。
Sources
関連
- Dispatch
- プロジェクト
- Dispatch
- プロジェクト
- Dispatch