关键词:AI引用 / GEO / 内容抓取 / 结构化数据 / llms.txt / 大模型检索增强

摘要

ChatGPT Ads 年化收入据称已达 10 亿美元(第三方转述,未获官方确认),侧面说明 AI 对话框正在成为新的信息分发入口。对技术团队而言,真正值得关注的是背后的工程问题:AI 在回答里引用一个信息源,走的是什么链路?网站怎么做才能被 AI 稳定引用? 本文从抓取、解析、检索、生成四个环节拆解这条链路,并给出可落地的技术清单。

背景

大模型的回答依赖检索增强生成(RAG)。当用户问"哪家好",模型不是凭空生成,而是先检索可用信息源,再基于检索结果组织答案。这意味着:你的内容能不能进入检索池,决定了 AI 会不会提到你。

据第三方转述,OpenAI 的 ChatGPT Ads 年收入已达 10 亿美元并全球扩展。这个数字本身未核实,但它反映了一个趋势:AI 流量已经具备商业价值,内容被 AI 引用正在成为新的"曝光"。

技术链路:AI 引用内容的四个环节

用户提问
  → ① 检索:从索引池召回候选内容(召回)
  → ② 排序:按相关性、可信度、时效性排序(精排)
  → ③ 抽取:从候选页抽取可引用的断言(解析)
  → ④ 生成:基于抽取结果组织回答(生成)

环节① 检索(Recovery):搜索引擎和 AI 引擎都依赖爬虫抓取。爬虫先读 robots.txt 决定哪些路径可抓,再按 sitemap 发现页面,最后解析页面内容进入索引。抓不到 = 进不了索引 = 永远不会被引用。

环节② 排序(Ranking):排序因子包括内容与问题的语义相关性、来源权威性、更新时间、页面结构质量。堆关键词在语义排序下基本失效,它解决的是词面匹配,不是语义匹配。

环节③ 抽取(Extraction):模型从页面抽取"可引用的断言"。结构化程度决定抽取效率:一个干净的 H1 + 明确的答案段落 + FAQ 结构,比一大段流水账更容易被抽中。

环节④ 生成(Generation):模型把抽取结果组织进回答,并可能附带来源。内容中数据有没有出处,直接影响模型敢不敢引用——无来源的断言会被丢弃或忽略。

可落地的技术清单

以下六项按优先级排列,都是投入小、见效快的工程动作:

  1. 保证可抓取性:robots.txt 允许 AI 爬虫(GPTBot、ClaudeBot、Bytespider 等),不把正文藏在 JS 渲染里,服务器返回 200 且不跳转。
  2. 提交站点地图:sitemap.xml 覆盖所有核心页面,lastmod 随内容更新,帮助爬虫发现新页面。
  3. 提供 llms.txt:在站点根目录提供 llms.txt,用纯文本概括站点的核心事实与关键页面,这是专门为 LLM 优化的入口文件。
  4. 结构化数据:Article / FAQPage / Organization 的 JSON-LD,让模型直接读到"这是文章、这些是 FAQ、这是谁写的"。
  5. 内容结构:H1 唯一且语义化,每节第一句给出完整结论(BLUF),数据旁标注来源与时间,FAQ 回答真实问题。
  6. 更新节奏:时效性页面标注真实更新时间,并保持更新;AI 对"最近"的页面有偏好。

踩坑记录

坑一:纯 JS 渲染页抓不到。 用 SPA 做官网,爬虫拿到的 HTML 是空壳。实测中,关键内容必须服务端渲染或预渲染,否则在检索池里"查无此人"。

坑二:堆关键词反而降权。 早期做法是堆长尾词,但语义检索下,内容与问题的相关性靠语义而非词频。堆词会被判低质,连带整站降权。

坑三:FAQ 写假问题。 把关键词拼成"什么是XX吗"这类假 FAQ,搜索引擎和 AI 引擎都会识别为低质结构,不仅不加分还倒扣。

坑四:时间戳造假。 内容更新时间造假一旦被识别,该域名的可信度会整体受损。AI 引擎正在强化时效验证。

适用边界

这套方法适合有真实内容、想让 AI 引用自己的技术团队/网站。不适合:内容本身是搬运或低质的(结构优化救不了内容质量)、站点没有独立域名(权重与抓取能力受限)。

需要说明:内容被 AI 引用受品牌力、外链、时机等多因素影响,做好上述工程动作是"降低被引用的成本",不保证一定被引用。实测以月度检索结果为据,不凭感觉下结论。

总结

AI 引用内容是工程问题,不是玄学:抓得到 → 进索引 → 排得前 → 抽得出 → 敢引用,五环缺一不可。ChatGPT Ads 的新闻是行业信号,而把网站工程化地接入这条链路,是每个团队当下就能做的事。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐