AI 为什么引用维基百科而不引用你:生成式引擎引用行为的实证观察
过去一年里,几份大规模实证研究把"AI 搜索到底引用谁"这个问题从猜测变成了可观测的数据。本文梳理这些研究的核心发现,尝试解释背后的机制,并讨论对内容开发者的实际意义。文中数据均标注出处,可对照原文核查。
一、一个反常的统计结果
SEO 工具厂商 Ahrefs 在 2025 年做了一项实验:取 15000 条真实长尾查询,分别在 Google、Bing 里检索,再把同样的问题抛给 ChatGPT、Gemini、Copilot、Perplexity,然后逐一比对这些 AI 助手引用的 URL 和传统搜索结果的重合度。
结果有点反直觉:
- ChatGPT、Gemini、Copilot 引用的链接里,平均只有约 12% 同时排在 Google 前十;
- 反过来算,这些 AI 引用的 URL 中约八成在 Google 对该查询的排名中根本不存在——不是排得靠后,是完全没有排名;
- 在 Bing 一侧情况类似,重合度约 10%。
也就是说,AI 助手的引用名单和传统搜索的排名名单,几乎是两套班子。Google 排名第一页,既不保证被 AI 引用;Google 排不上名,也不妨碍被 AI 引用。
Ahrefs 的另一项分析更直接:他们导出 2025 年 9 月 ChatGPT 引用量最高的 1000 个页面,发现其中 28% 的页面在 Google 上零自然可见度——一个关键词排名都没有,却隔三差五被 AI 写进答案。
先记住这组数字,它是本文后面所有讨论的出发点:如果引用机制只是"把搜索结果念一遍",这些数据不可能出现。AI 选来源的逻辑,和搜索排名的逻辑,是两种不同的东西。
二、各引擎的引用偏好画像
Ahrefs 的 Brand Radar 数据集覆盖约 7860 万次 AI 搜索(2025 年 6 月数据),统计了 ChatGPT、Perplexity、Google AI Overviews 三个系统提及最多的域名。几个值得注意的事实:
|
来源类型 |
ChatGPT |
Perplexity |
AI Overviews |
|
维基百科 |
16.3% |
12.5% |
8.4% |
|
YouTube |
未进前列 |
16.1% |
9.5% |
|
|
未进前十 |
未进前十 |
7.4% |
|
新闻媒体(路透等) |
2.6%–4% |
次要 |
次要 |
三个系统都偏爱维基百科,但偏好结构差异明显:ChatGPT 对新闻类站点情有独钟;Perplexity 大量引用 YouTube;AI Overviews 则明显偏向 Reddit、Quora 这类 UGC 社区——这很符合直觉,Google 自己的搜索结果页这两年也在给社区内容加权。
还有一个值得单独说的例外:Perplexity 与 Google 前十的重合度是 28.6%,远高于其他 AI 助手的 8% 左右。原因在产品设计——Perplexity 从第一天起就定位成"答案引擎",以密集引用为卖点,自建了搜索索引,行为上最接近传统搜索。而 Google 自己的 AI Overviews 有 76% 的引用来自搜索前十,说明它更像传统搜索的延伸层,而不是独立的新系统。
这组画像给出一个朴素结论:不存在统一的"AI 引用偏好",每个系统的口味由它的产品定位和数据管线决定。任何声称"一招通吃所有 AI 搜索"的说法,在这些数据面前都站不住。
还有一组常被忽略的背景数据,能说明这场变化进行到了什么程度:Ahrefs 统计,自 2023 年 8 月以来,活跃的主流 AI 爬虫数量翻了一倍,达到 21 个;在部分站点的访问日志里,AI 爬虫的请求量已占到约四分之一,仅次于传统搜索引擎爬虫。被屏蔽最多的是 OpenAI 的 GPTBot,约 5.89% 的网站在 robots.txt 里明确拒绝了它。也就是说,"AI 在读网页"已经不是趋势预判,而是访问日志里每天都在发生的既成事实——区别只在于你的站点在不在它们的阅读名单里。
另外一个值得知道的参照数据:ZipTie 的研究发现,即使在 Google 传统结果排第一的页面,被 AI Overviews 引用的概率也只有 25% 左右。排名第一尚且如此,这从侧面再次印证了前面的判断——排名和引用是两个相对独立的筛选过程。
三、机制:模型选来源时到底在看什么
数据是"是什么",更值得关注的是"为什么"。结合几篇相关研究,我认为有四个机制在起作用。
3.1 训练语料的先验:维基百科是模型的"母语环境"
大模型在预训练阶段就反复读过维基百科——它是几乎所有训练语料里质量最高、清洗最认真的部分。这造就了一种深层偏好:模型对"维基百科式的文本"(定义先行、结构规整、陈述克制、事实密集)有天然的亲和度。
这解释了为什么维基百科在三个系统里都占据引用榜首,也解释了一个对内容开发者有用的推论:写法上接近百科全书的页面,和模型的"语感"更合拍。不是说要写得像字典那么枯燥,而是说清晰的定义、中立的陈述、规整的结构,这些特征本身就是模型熟悉且信任的文本形态。
3.2 位置偏置:长文档的中间部分会被"漏读"
斯坦福大学 Liu 等人的论文《Lost in the Middle: How Language Models Use Long Contexts》(TACL 2024)系统测量了大模型处理长上下文时的表现,发现一个稳定的 U 型曲线:模型对开头和结尾的信息利用最好,对中间部分的信息利用显著下降——即使相关信息明明就在那里,准确率也会掉一截。
AI 搜索把你的网页切开后喂给模型时,你的内容会被放在上下文的哪个位置,你控制不了。但你能控制自己页面内部的结构:关键结论放在小节开头、重要事实不埋在长段落腹部。这篇论文经常被 RAG 领域的工程师引用,它提醒我们"被检索到"和"被模型真正读到"之间还隔着一层注意力分配问题。
3.3 可验证性:模型偏爱"能被其他来源证实"的陈述
这是我认为最重要、也最被低估的一条机制。
RAG 系统生成答案时会把多个来源的内容放进同一个上下文。当你的陈述和其他来源相互印证时,它就是"安全"的;当你的说法独此一家、和谁都对不上时,模型采用它的风险就高。从工程角度看,这是一种隐式的交叉验证——模型在概率上偏爱处于"共识区"的信息。
这和 Ahrefs 的另一组数据互相印证:全网被提及次数最多的品牌,在 AI Overviews 里的提及量可达下一个梯队的 10 倍;而 26% 的品牌在 AI Overviews 中一次都没有被提及。头部效应如此极端,背后正是交叉验证机制在起作用——被多方反复提及的实体,对模型来说是"低置信成本"的选择。
3.4 时效信号:新内容有真实的加成
Ahrefs 的数据还显示,ChatGPT 是各平台中最倾向于引用新内容的,其文内引用按时间从新到旧排序;那 28% 零 Google 可见度的被引页面中,相当一部分是尚未积累搜索排名的新页面。AI 系统对新内容的发现和采纳,可以跑在搜索引擎的排名周期前面。
这背后没有太深的玄机:检索系统普遍把发布时间作为筛选和排序信号之一。但它带来一个反常识的推论——在 AI 检索的语境里,维护旧内容的时间戳和持续更新,比在传统搜索里更值钱。一篇 2023 年写就、之后从未更新的"XX 指南",在模型眼里和"可能过时"几乎同义。
3.5 检索不是必然发生的:引用竞争只存在于"模型没把握的问题"上
最后一个机制容易被忽略:AI 助手并不是对每个问题都去检索。
以 ChatGPT 为例,多项观察显示它内部有一个触发判断——当模型认为答案可以从训练数据里稳定得出时,就直接回答,不发起联网搜索;只有当问题超出把握(太新、太偏、太具体)时,检索才被触发。Perplexity 这类以检索为底色的产品是例外,但对主流助手来说,"先想想自己知不知道,不知道再查"是常态。
这个机制的推论相当重要:引用竞争只发生在模型知识边界之外的查询上。"什么是机器学习"这种问题,模型闭着眼睛都能答,你的页面写得再好也进不了答案——它根本不需要来源。真正会产生引用的,是新出现的事物、细分的事实、实时的信息、训练数据覆盖不到的长尾。这和第四节"缝隙在长尾"的观察是同一个结论的两个侧面:机会不光因为头部站点没写那些内容,更因为只有那些查询才会触发检索这个环节本身。
对内容选题来说,这意味着一个简单有效的自查:在动笔之前,先把你的目标问题原样问一遍主流 AI。如果它脱网就能答得头头是道,这个选题基本不会有引用空间;如果它答得含糊、需要联网、引用的来源质量平平——那里才是你的位置。
四、"死引用"格局:三分之二的引用位你争不到
在给实操建议之前,先得泼一盆冷水,这也是 Ahrefs 数据里最容易被忽略的发现。
ChatGPT 引用量最高的 1000 个页面中,约三分之二属于"无法影响"的类型:维基百科词条、各大机构的官网首页、应用商店页面。研究团队称之为"dead citations"——这些引用位客观存在,但你没有任何现实手段把自己的内容放进去。真正可以通过内容和外联争取的引用位,只占约三分之一。
而那些能被引用、同时又有搜索排名的页面,中位 DR(域名权重)高达 90——基本是头部站点的游戏。
把这几块拼起来,引用市场的真实结构是:
- 一大块被维基百科、巨头官网这类"基础设施级"来源占据,不可争取;
- 可争取的三分之一里,头部高权重站点又拿走主要份额;
- 剩下的缝隙,才是普通内容站点的真实战场——主要是长尾、细分、新问题。
这听起来丧,但换个角度是好消息:它说明了为什么那 28% 零排名页面能被引用——在细到一定程度的查询上,头部站点根本没有内容,AI 只能引用那些"唯一能回答这个问题"的页面。缝隙不是残羹冷炙,是结构性机会。
五、推论:可争取的引用位怎么拿
基于上面的机制,四条可执行的推论。我不打算写成清单体口号,每条都说清楚依据。
第一,成为一手来源,而不是二道贩子。
整条内容供应链里,最不可替代的是信息的起点:原创数据、自己跑的实验、第一手的统计、独家的案例。二手转述可以被任何人复制,模型引用谁都没差别;一手来源只有一个,模型要覆盖这个事实就绕不开你。Ahrefs 自己的研究就是最好的示范——这个厂商持续发布原创数据研究,然后这些研究被包括本文在内的无数内容引用。
注意,一手来源不是只有大公司玩得起。一个细分领域的用户调查(哪怕样本只有几百份)、一次小规模但方法交代清楚的对比测试、一份持续维护的行业数据整理、一个真实踩坑过程的完整复盘,都算一手来源。关键不在规模,在于不可替代性:这个事实的最初出处是你,别人要写这个话题就得提到你,模型也一样。反过来说,"整理十个别人的观点加一段自己的感想"这种内容形态,在语义检索时代是最先被淘汰的——它没有任何独占信息,向量空间里和它相似的文本有成千上万篇。
第二,让同一事实在多个可信节点出现。
对应交叉验证机制。你的核心数据和结论,应该在自己的站点、行业社区、百科类平台、媒体报道里保持一致地存在。模型在多个独立来源里看到同一件事,采用它的置信成本就大幅下降。反过来,孤证——只有你自己网站上说的事——在机制上天然吃亏。这一条在执行上容易走歪成"铺软文",区别在于:铺软文是重复广告,共识建设是让同一个事实被不同立场的来源独立确认。前者模型一眼能看穿(措辞雷同、来源同质),后者才是机制真正奖励的东西。
第三,把时效维护当成内容工作的一部分。
对应时效信号机制。具体做法不复杂:给重要内容标注发布和更新时间;定期复核数据类内容,过时的数字就更新;更新后真正修改时间戳而不是假装更新。检索系统对"明确维护中的内容"和"疑似弃坑的内容"是有区分的,这个区分会传导到引用决策。
第四,用长尾内容填补结构缝隙。
对应"28% 零排名页面"和"死引用格局"。不要盯着头部大词写第五十篇"XX 是什么"——那个位置被维基百科和巨头官网焊死了。去找那些真实存在但还没有好答案的细分问题:你工作中实际踩过的坑、客户反复问的具体场景、某个工具链的冷门组合。在这些查询上,你不是在和高权重站点竞争,你是在和"没有内容"竞争,胜率完全不同。
六、方法论的边界:读这些数据时要带的三点保留
诚实起见,必须说明本文引用数据的局限。
其一,这些是观察性研究,不是因果实验。 Ahrefs 的数据能告诉我们"被引用的页面长什么样",不能严格证明"因为做了 X 所以被引用"。相关不等于因果,本文第四、五节的机制解释是基于多源证据的合理推断,不是被严格证明的定律。
其二,样本偏向英文互联网。 这些研究的查询集和引用集以英文内容为主。中文 AI 搜索产品的引用偏好——对自家生态内容的倾斜、对中文社区平台的选择——目前几乎没有公开的同等级研究,直接照搬英文结论是有风险的。这其实也是一个值得有人去做的研究方向:用同样的方法(固定查询集、定期采样、比对引用名单)对中文产品做一次系统观察,谁先做出来,谁就拥有了这个领域的一手数据——这本身就是本文第四节观点的一次实践机会。
其三,引用策略在快速变化。 这些数据反映的是 2025 年中的系统行为,而各厂商的检索管线几个月就会调整。GEO 原论文(KDD 2024)的实验结论和真实引擎的表现之间就已经存在明显差距,今天的数据和一年后的现实之间同样会有。把任何具体数字当成长期有效的规则,都是危险的;值得长期持有的只有机制层面的理解——语义匹配、交叉验证、时效偏好这些机制,比任何统计数字都稳定。
七、结语
把这些研究放在一起,生成式引擎的引用逻辑其实不难概括:它有自己熟悉的文本形态(百科式),有自己信任的验证方式(多源共识),有自己的时效要求(明确维护),还有一大片早已名花有主的引用位(基础设施级来源)。留给普通内容创作者的空间真实存在,但形态和过去不同——不是"把大词做到第一",而是"成为某个细分事实无法绕开的一手出处"。
这个转变往深里说,其实是内容价值的评判标准在向"信息增量"回归。搜索引擎时代,包装和权重可以弥补增量的不足;生成式引擎时代,模型在语义层面工作,增量不够的内容连被区分开的资格都没有。对认真做内容的人来说,这未必是坏消息。
参考资料
1. Louise Linehan, Xibeijia Guan. *Only 12% of AI Cited URLs Rank in Google's Top 10 for the Original Prompt*. Ahrefs Blog, 2025
2. Louise Linehan. *67% of ChatGPT's Top 1,000 Citations Are Off-Limits to Marketers*. Ahrefs Blog, 2025
3. Ahrefs. *The 10 Most Mentioned Domains for ChatGPT, Perplexity, and AI Overviews Across 78.6M Searches*. Ahrefs Blog, 2025
4. Liu N. F., Lin K., Hewitt J., et al. *Lost in the Middle: How Language Models Use Long Contexts*. TACL 2024
5. Aggarwal P., Murahari V., Rajpurohit T., et al. *GEO: Generative Engine Optimization*. KDD 2024. arXiv:2311.09735
6. Gao Y., Xiong Y., Gao X., et al. *Retrieval-Augmented Generation for Large Language Models: A Survey*. arXiv:2312.10997, 2023
注:文中提到的几份原始研究报告,以及我自己持续记录的一份引用观察笔记,都整理在了 https://geo.shataojin.net ,可以作为阅读时的对照材料。数据会随各引擎策略调整而变化,建议以原始出处为准。
更多推荐



所有评论(0)