Perplexity AI Grounding Analysis: Manufactured Sources and AI-Generated Buying Guides
AI Retrieval Systems are Grounding Recommendations in Low-Authority Domains
對網頁落地(web-grounded)AI 模型的研究顯示,產品推薦高度依賴低權威性與機器生成的內容。在針對 380 個軟體類別使用 perplexity/sonar 與 perplexity/sonar-pro 進行的測試中,7,534 個引用中有 83.2% 指向了在 Tranco top-1M 名單中排名低於 #100,000 的網域,或是完全未進入前一百萬名的網域。
Distribution of Citation Authority
Perplexity 模型的檢索層顯示出高權威網站的集中度明顯不足。雖然前十大被引用網域佔了 17.3% 的引用,但其餘四分之三的證據基礎是由長尾來源構成的。具體而言,36.5% 的被引用網域並未出現在 Tranco 前一百萬名中。這些未排名的網域明顯較新,其 Wayback Machine 的中位數首次擷取時間為 2020 年,而已排名的網域則為 2011 年。
| Domain | Citations | Share | Tranco rank |
|---|---|---|---|
| g2.com | 291 | 3.86% | 4,027 |
| reddit.com | 261 | 3.46% | 105 |
| guideflow.com | 194 | 2.57% | 177,039 |
| gartner.com | 158 | 2.10% | 1,766 |
| zapier.com | 82 | 1.09% | 2,919 |
The Rise of """Grounding Pages""" for AI SEO
一個由三個網域組成的網絡——wifitalents.com、worldmetrics.org 與 gitnux.org——被識別為專門為 AI 檢索系統設計的製造內容的主要來源。這些網站全部註冊於 2023 年 12 月至 2024 年 5 月之間,並共享相同的 Cloudflare nameservers、頁面模板與導覽結構。
Scale of Machine-Generated Content
這三個網站總共發布了 215,128 個機器生成的 best <category> 頁面。這種操作的規模遠超現有的軟體類別數量,顯示出其透過程式化方式來獲取 AI 搜尋流量的意圖。
Targeting the Retrieval Layer
與針對人類讀者的傳統 SEO 不同,這些網站明確針對 AI 的「落地(grounding)」過程。worldmetrics.org 與 gitnux.org 使用了如 "Facts & Grounding Page" 的 HTML 標題,以及將自己描述為 "machine-readable record[s] of verified facts" 的 meta descriptions。這顯示了向「AI 引擎優化」(AEO)的轉移,即內容被特別結構化以供 LLM 檢索層使用。
Inconsistencies in AI-Generated Recommendations
儘管表現得像是權威研究機構,但該製造網站網絡為相同的軟體類別提供了相互矛盾的排名。以 "project estimation software" 類別別為例,儘管使用了相同的模板並聲稱是 "AI-verified" 或 "Expert reviewed" 流程,這三個網站卻提供了三個不同的頂級工具排名。
此外,檢索過程可能導致幻覺或危險的連結。在研究樣本中提供的 1,502 個供應商首頁中:
- 1.1% 的連結已失效或無法到達。
- 6.1% 重定向至不同網域。
- 當模型被要求提供研究數據平台與數據品質工具時,部分引用指向了無關的網站,例如印尼的線上賭博門戶網站與摩洛哥的飯店與賭場集團。
Community Insights and Counterpoints
技術用戶之間的討論顯示,這種現象是 AI 生態系統中更廣泛的「AI slop」與循環推理的趨勢之一。
"The search engine is now the citation, and the citation is a page that exists to be cited. Nobody in that loop has read anything, and it still works."
社群提出的關鍵疑慮包括:
- Model Preference for AI Content: 社群用戶報告稱,LLMs tend to favor AI-generated passages over human-written ones,即 LLMs 傾向於優先使用 AI 生成的段落,而非人類寫作的內容,這會造成一個回饋圈,使得模型在訓練與引用引用自己產出的內容。
- Source Skepticism: 目前的代理型工作流(agentic workflows)中被認為缺乏「來源可靠性懷疑精神」,即模型無法考慮發布資訊的動機,使得它們容易受到「付費換取驗證」的驗證系統影響。
Methodology and Scope
該研究專注於透過 OpenRouter 使用 Perplexity AI 的 sonar 與 sonar-pro 模型。研究使用了 380 個購買意圖類別與 760 次總呼叫。研究人員指出,結果反映了檢索索引的快照,並不一定代表 ChatGPT、Gemini 或 Copilot 等其他 AI 搜尋引擎的表現。
Sources
相關
- Dispatch
- 專案
- Dispatch
- 專案
- Dispatch