21.5 萬頁機器生成內容正在「接地」AI 的答案:Trellner 揭露 Perplexity 引用供應鏈
Trellner Research 對 Perplexity 的 sonar 模型投放 380 組採購意圖查詢,發現 7,534 筆引用中有 59.8% 指向全球前 10 萬名以外的網域——三個機器生成的「最佳軟體」內容農場供應了 215,128 頁明寫著「Facts & Grounding Page」、專門給模型讀的頁面。
2026 年 9 月 2 日,一份研究報告以一個異常精確的數字作為標題登場:215,128。這是三個網站合力發布的機器生成「最佳軟體」採購指南總頁數——而它們共同構成了 Perplexity 產品推薦背後證據基礎的一個可觀切片。這份編號 TR-2026-009、題為《AI 推薦背後的製造化來源》(Manufactured sources behind AI recommendations)的報告出自 Trellner Research,是迄今為止對一個 AI 產業討論了兩年、卻始終停留在抽象層面的威脅最詳細的解剖:一種不以人類讀者為目標、而是瞄準 AI 答案引擎檢索步驟的搜尋引擎最佳化。
這些發現值得用研究本身審視其研究對象的同等嚴格態度來檢驗。但就表面數字而言,它們描述的是 AI 搜尋心臟地帶的一個供應鏈問題:當模型透過「接地」(grounding)抓取文件來支撐答案時,它抓到的文件,可能正是為了這個目的而被製造出來的。
研究怎麼做
方法論出乎意料地具體。2026 年 9 月 2 日,Trellner 向 Perplexity 的兩個模型——sonar 與 sonar-pro(經 OpenRouter 呼叫)——投放了 380 組採購意圖軟體類別,從「CRM 軟體」到「博物館藏品管理軟體」。每個類別、每個模型各一個提示,共 760 次呼叫。每次呼叫都要求以 JSON 格式回傳排名前五的清單,並附上每個產品的官方首頁網域。
760 次呼叫全部回傳可解析的答案,而且兩個模型都會回報它們檢索過的 URL——正是這個特性使它們成為合適的研究對象。類別清單在看見任何結果之前就寫定,且從未修改——這種預註冊紀律在此類研究中相當罕見。
收穫如下:3,800 個推薦欄位、1,807 個不同產品、7,534 筆引用、橫跨 2,055 個不同網域。接著每一個被引用的網域都在 Tranco 清單(以真實流量排名前一百萬網域的標準排行榜,取 2026 年 9 月 1 日版本)與 Wayback Machine 中查證。模型提供的 1,502 個廠商首頁也全部被抓取兩次——一次直連、一次透過輪替代理——以確認它們是否仍然存在。
Google 被刻意排除在外:透過 OpenRouter 接地 Gemini 模型,實際走的是 OpenRouter 自家的網頁搜尋外掛,引用結果描述的會是那個外掛而非 Google 的檢索。這個範圍紀律值得特別強調,因為它正是這些數字可信的原因:研究只測量了 Perplexity,報告中也白紙黑字地如此聲明。
引用落在哪裡
整體分布相當刺眼:
- 7,534 筆引用中,59.8% 指向 Tranco 排名十萬名之後的網域。
- 23.4% 指向根本不在前一百萬名內的網域。
- 指向有排名網域的引用,中位數 Tranco 排名為 71,611。
頭部的集中度並不異常——被引用最多的十個網域只占 17.3%,所以問題不是知名網站卡特爾壟斷了答案。問題在於填滿另外五分之四的東西:2,055 個被引用網域中,有 751 個(36.5%)不在前一百萬名內。
這些網域也更年輕。未排名網域的 Wayback 首次收錄中位數是 2020 年,而有排名者是 2011 年;未排名網域中 16.6% 在 2025 年或之後才首次被收錄,有排名者僅 1.6%。AI 接地的長尾,是一張年輕的網——一張與現在引用它的答案引擎一同長大的網。
作為對比,維基百科在 7,534 筆引用中只出現了三次。
那座成為第三大引用來源的廠商部落格
報告中最發人深省的案例研究,其實不是內容農場,而是 Guideflow——一家銷售互動式產品示範的公司。它不是評測網站、不是名錄、也不是出版商,而且在 380 個類別中一個都不競爭。但它的行銷部落格被引用了 194 次、涵蓋 380 個類別中的 96 個(四分之一)——名列整體第三,排在 Gartner 之前。
每一筆引用都是不同的 URL:96 個不同的部落格網址,每個類別一個,其中六個是同一篇文章的愛沙尼亞語版本。它的網站地圖列出 3,351 個部落格 URL,其中 2,176 個是不同文章。它同時為「3D 渲染軟體」「IVR 軟體」「RFID 軟體」「建築事務所軟體」提供了接地依據。
正如報告謹慎指出的,Guideflow 的所作所為沒有任何欺騙——它只是像數千家公司一樣經營大型內容行銷部落格。真正的發現在於檢索層如何使用它:一家廠商關於自己不經營市場的清單文,成了「該買哪個產品」這個問題的第三大證據來源。
「Facts & Grounding Page」:內容農場直接對機器喊話
然後是農場本身。三個網站——Gitnux、Worldmetrics、WifiTalents——分別被引用 71、50 與 60 次(合計 181 筆,占總數 2.4%),出現在 380 個類別中的 41 個。
它們是同一個操作的證據雖屬旁證但十分綿密。三個網域都在 2023 年 12 月至 2024 年 5 月間透過 NameCheap 註冊;都把 DNS 委派給同一對 Cloudflare 名稱伺服器(pam 與 sean.ns.cloudflare.com);都用同一套頁面模板與導覽——Services、Market Data、Software Advice、Editorial Process、Company——而且各有一個恰好六篇文章的部落格,全部十八篇都在寫集合中的其他品牌。同一對名稱伺服器上還有第四個品牌,首頁掛著同樣的標題。
規模本身就是重點。三個網站的 sitemap 分別列出 103,578、107,083 與 105,541 個 URL,其中 70,731、71,684 與 72,713 個遵循 /best/<某種>-software/ 的模式。也就是三個品牌合計 215,128 頁生成式採購指南,對應各六篇部落格文章。正如報告的乾燥註解:世界上並不存在 215,128 種軟體類別。
真正讓這些網站與眾不同的是它們的自我描述。2026 年 9 月 2 日抓取時,其中兩個的首頁 HTML 標題是 <品牌> — Facts & Grounding Page,meta 描述除品牌名外完全相同:「關於 [Gitnux] 的已驗證事實……公司、法律、方法論與合規細節,整合於一份機器可讀紀錄。」
「Grounding」不是買家會用的詞。它是檢索系統抓取文件以條件化答案的那個步驟的名稱。一份關於自身、機器可讀的已驗證事實紀錄,也不是為人類讀者提供的服務。這些頁面在標題與描述中,明明白白地寫給讀它們的軟體看。 而且這種「被讀到」也可以用寻常方式購買:其中一個網站公開廣告客製市場研究「€5,000 起」、現成報告「€499 起」、廠商選型「€2,500 起」——就架在被模型檢索的同一套 Best Lists 分類之上。
一套模板,三種結論
為了檢驗編輯實質,Trellner 從三個品牌抓取了同一個類別頁——「專案估算軟體」。每個頁面都以 JSON-LD 宣告排名,因此可以不經詮釋直接讀取。每頁排名十個工具,顯示前五名。
Gitnux 的冠軍根本沒有出現在 Worldmetrics 的前五名裡。 每個頁面都掛了三位署名人員——一個問題,九個不同的人。每頁都宣稱編輯流程;Gitnux 把結果標為「AI-verified · Expert reviewed」。三個頁面的署名列都留著一個未渲染的模板變數,其中兩個顯示「Within the next 26 days」、第三個顯示「Within the next 40 days」——批量生成的鐵證,沒有任何 人類編輯抓到,因為根本沒有人類編輯。
推薦本身指向哪裡
模型提供的 1,502 個廠商首頁大致正常,而且每個都查了兩次。十個完全無法解析——八個沒有委派任何名稱伺服器——包括被當作 GraphiQL、Microsoft To Do 與 Trivy 官方網站提供的網域。另有 92 個(6.1%)重導向到不同的註冊網域,多數是正常的併購與改品牌。
兩個重導向更離奇,而且兩個模型版本都中招。問研究資料管理平台,兩個都推薦 Dryad——但其中一個引用網域重導向到標題為「BIGSLOT288 | Portal Game Online」的印尼線上賭博入口。問資料品質工具,兩個都推薦 Monte Carlo——其中一筆引用重導向到蒙特卡洛濱海集團(Monte-Carlo Société des Bains de Mer),摩納哥的飯店與賭場集團。
這份研究沒有證明什麼
限制章節值得與發現本身同等重視,因為它正是「測量」與「恐慌製造」的分界線:
- 兩個模型不是兩次獨立測量。 它們在 380 個類別中的 289 個回傳了逐位元組相同的引用清單,URL 集合的 Jaccard 相似度達 0.898。Perplexity 的兩個版本共用檢索層,應視為同一搜尋架構的兩次取樣。
- 結果僅涵蓋 Perplexity。 ChatGPT、Gemini、Copilot 與 Google AI Mode 皆未測量,也沒有理由假設它們的檢索組成相同。
- 380 個類別是研究者自建的,偏重利基垂直市場——這會比常見查詢浮出更多長尾來源。
- 被引用不等於正確。 研究並未測試移除這些來源是否會改變推薦結果;農場列出的產品或許合理。測量的是證據基礎由哪些文件構成。
- Tranco 排名衡量流行度,不是品質。 排名低不是指控;對特定網站的每項主張,都建立在該網站自己的頁面上,並在資料集中連結與存檔。
完整資料集——每一筆引用、每一個推薦、Tranco 與 Wayback 查證、廠商存活檢查,以及產生上述每個數字的腳本——以 CC BY 4.0 釋出。
分析:GEO 時代來臨,事實基底開始動搖
這件事早有名字:GEO,生成式引擎最佳化(generative engine optimization)。傳統 SEO 遊戲的是人類最終會看到的排名;GEO 遊戲的是檢索步驟——模型挑選來源的那個看不見的瞬間。一個永遠上不了 Google 首頁的內容農場,仍然可以被指名道姓地引用在一個自信滿滿的 AI 答案裡,因為檢索層最佳化的是「存在一個符合此查詢的頁面」,而不是「一個人會信任的來源」。
經濟學殘酷且不對稱。一頁生成內容的成本不到一分錢;AI 答案裡的一筆引用價值真金白銀——報告的配套報導發現,中位數公司只出現在它想出現的 AI 答案中的 16%,被引用的只有 6%。答案引擎頁面正在成為一種「製造化格式」,正當的行銷人員如今要與早已摸透檢索器喜好的內容農場競爭。
還有一個更深的結構性問題。答案引擎創造了對接地引用的需求,而網路以製造供給回應。當 AI 答案成為產品研究的主導介面,建造「寫給模型看」頁面的動機就會複利放大。這是一個反向回授迴路:模型越接地,事實基底就越是被為它們製造。維基百科——網路上最接近中立知識公共財的東西——在 7,534 筆引用中出現三次,而兩座「Facts & Grounding Page」農場和一個廠商部落格的排名都在它之上。
對於建立在檢索增強系統上的開發者與企業,實務啟示很具體。網域聲譽先驗(如 Tranco 排名)是便宜且區分度出乎意料好的檢索過濾訊號;引用多樣性要求可防單一來源家族壟斷;而這份研究的方法論——預註冊查詢、完整引用日誌、獨立存活檢查——是任何 RAG 營運者都可以直接抄走、用來稽核自身檢索組成的模板。
對其他人來說,建議更簡單。當 AI 搜尋引擎給你一個附來源的答案,那筆引用正在默默做很多讓它顯得權威的工作。先點進去看,再決定信不信。模型確認過那個頁面存在;它沒有確認過那個頁面配得上被信任。
Sources
- [1] https://trellner.com/reports/manufactured-sources-behind-ai-recommendations/
- [2] https://onthewire.ai/article/215-128-fake-best-software-pages-were-built-to-be-read-by-ai-and-perplexity-is-c
- [3] https://artdirectiondaily.com/issues/2026-09-02-webflow-stops-requiring-webflow.html
- [4] https://www.explainx.ai/blog/ai-recommendation-sources-manufactured-geo-farms-trellner-2026