一句话结论:实体识别用于判断页面上的某个名称对应引擎已知的哪一个实体。只有将提及、引用或标记中的断言对应到正确的实体节点,相关信用才会记到应归属的实体名下;一旦解析失败,信用就会失去归属、被归到错误对象名下,甚至完全不被计入。


一、被点名不等于被认出来

你可能已经做了很多 GEO 工作:内容被 AI 引用、品牌被站外提及、结构化数据也加了。但有没有想过一个问题——AI 引擎真的知道这些信用该记到你头上吗?

生成式答案署名给的是一个实体,而不是一串字符。如果引擎无法把页面上的名称对应到已知的规范实体,那么提及、引用或标记带来的信用就无法归属,或者会被归到其他同名实体名下。这就是实体识别(entity recognition)要解决的问题——它是整条链路中最容易被忽视、却最关键的一步。

这篇把实体识别拆成机制、输入、平台差异、反模式四个层面,讲清楚:为什么未解析的实体拿不到信用、引擎如何解析、如何让自己的实体被可靠解析。

二、实体识别是什么

实体识别是一套机制,决定 AI 引擎能否分辨你是谁、你是什么,并把你获得的各种信号归到正确的实体节点上。

GEO Wiki 的工作定义:在 GEO 语境下,实体识别是 AI 引擎把一个表层名称(surface form,也就是页面或查询中出现的品牌、产品、作者字符串)对应到已知的规范实体(canonical entity),并与同名实体区分开的过程。只有完成这一步,与这串字符相关的信用才能归于正确的节点。

它需要与三个相关概念区分开:

  • 解析 ≠ 可被引述:让一段话可被原样取用,是可引用性的事。
  • 解析 ≠ 被信任:解析出的实体是否可信,是 E-E-A-T 的事。
  • 解析 ≠ 节点存在:Wikidata 节点本身是知识图谱存在度的事;实体识别解决的是如何把一次提及正确对应到该节点。

三、为什么未解析的实体拿不到信用

未被解析的实体,拿不到信用。 只有把一次提及、一次引用或一处标记断言对应到正确的实体节点,相关信用才会记到应归属的实体名下。名称未能解析时,即使被点名或引用,相应信用也不会生效。

正如品牌提及所说:“没有提及的链接,权威动作不完整”;可引用性也强调:“可引用是必要条件,不是充分条件”。解析是整条链路的关键一步,不是锦上添花。

 提及 / 引用 / sameAs 断言
 │
 ▼
 [ 实体解析层 ]  ← 本条目
 表层名称 → 候选 → 消歧 → 节点
 │
 ┌────────────┴────────────┐
 ▼                         ▼
 已解析                    未解析 / 错配
 → 先验与信用记到你的节点    → 信用被丢弃,或附着到错误实体
                           (同名冲突)

解析发生在检索之前的解析与实体层,Schema.org 标记也在这环节发挥作用。完成实体解析后,系统才进入答案循环的采信与选择环节,可引用性与 E-E-A-T 在这一环节影响判断。解析并不决定取用哪段内容,而是决定相应信用最终归于哪个实体。

四、机制:实体解析流程

解析的基本机制是先做命名实体识别(NER),再做实体链接(entity linking)

 表层名称 "Acme"(页面或查询里的字符串)
 │
 ▼
 候选生成  "Acme" 可能是哪些已知实体?
          (Acme 公司 · Acme 工具 · 同名乐队 …)
 │
 ▼
 消歧      上下文 + 共现 + 先验,挑出其一
 │
 ▼
 规范实体   信用最终附着的那个节点

消歧依赖三类输入,三者的权重并不相同;各平台正是因为主要依赖的输入不同而有差异:

输入如何影响解析来自哪里何时占主导
① 显式解析凭据一条直接指向正确实体节点、不会产生歧义的链接,让引擎无须再做推测sameAs、结构化标识符、权威主页链接会读取并解析结构化数据的索引集成型平台
② 消歧上下文提供足够线索,从多个可能匹配的实体中确定唯一对象一致的规范名称、各渠道一致的 NAP、每次提及附近的描述性共现词没有显式凭据时(开放网络上的大多数情形)
③ 模型既有先验在多个候选中优先选择训练时反复得到印证的实体训练数据和检索结果中有多少相互一致的信息支持该实体没有结构化层可读的纯 LLM 平台

sameAs 可以作为显式的解析凭据。 Google 明确说,它"在后台用于把你的组织与其他组织区分开"。具体而言,sameAs 声明本页所指的实体就是相应 Wikipedia/Wikidata 链接指向的实体;只有当全网其他信息都不与这项声明矛盾,引擎才会接受,并从多个候选中确定唯一节点。

五、怎样让实体得到可靠解析

提高解析的可靠性,关键在以下几项措施:

可采取的措施如何帮助解析对应输入常见失败
sameAs 或结构化标识符给引擎一条直接指向正确实体节点的显式链接缺少显式链接,实体始终无法对应到知识图谱节点
全网统一的规范名称与 NAP使不同渠道的提及都能对应到同一个候选实体各渠道身份信息不一致,系统持续生成多个候选
每次提及附近附带消歧上下文(角色、领域、限定词)通过语境把你与同名者区分开同名冲突未解决,信用归给规模更大的同名实体
一个已认领的知识图谱节点作为解析目标让解析最终对应到已有权威记录的实体① 与 ③缺少可对应的目标节点
选择有辨识度且能避开同名的名称从源头减少可能混淆的同名候选每次生成候选列表时,同名实体都更占优势

单方声明不足以确立身份;全网信息必须相互印证,形成唯一且一致的身份。 实体能否被可靠解析,正是这种一致性带来的结果。这个身份是否可信,才轮到 E-E-A-T 来判断。

六、不同平台如何解析实体

各平台都遵循上述流程,差异在于主要依赖哪一类输入:

平台占主导的解析输入
Google AI Overviews 与 AI Mode索引与知识图谱;主要依赖显式标识符(①),知识图谱用于补充判断
Google Gemini依赖共现与知识图谱节点(② 与 ③),知识图谱在无法明确解析时补充判断
ChatGPT 与 Perplexity(实时抓取)模型先验与实时抓取页面中的上下文(② 与 ③);生成答案时 JSON-LD 不会被当作知识图谱来解析,解析主要依赖模型先验与知识图谱,而不是抓取时读取页面上的标记

这是"加了 sameAs 也不保证解析"的关键原因:在纯 LLM 的实时抓取场景,引擎根本不读你的 JSON-LD。

七、证据说明了什么、又没说明什么

现有证据已充分支持实体解析机制的基本方向;但在品牌层面,投入越多是否一定解析得越可靠,目前并无定论:

证据能支持什么不能据此推出什么
实体获得的佐证越广泛,模型对它的回忆与处理就越可靠:模型能稳定解析热门实体,长尾实体不能(Kandpal 等;Mallen 等)这些论文度量的是对 Wikidata 事实的 QA 准确率,并以 Wikipedia 浏览量衡量热度,没有度量品牌实体解析。推广到品牌只能视为类比,不能当直接结论
索引集成型平台依靠显式标识符和知识图谱完成解析:Google 说 sameAs 用于把你的组织与其他组织区分开(可追溯到知识图谱 2012)只说明实体达到基本解析门槛,并不表示会因此获得排名加成
业界实践已把实体消歧(“实体漂移”“身份坍缩”)视为 AI 搜索首要问题(Search Engine Land,2026)只从业界实践佐证问题存在,不能独立证明机制或效应量

特别要注意:Aggarwal 等关于 GEO 的研究(KDD '24)度量的是页内内容改写(加引用、加统计、加引述),并不是实体解析。研究中最高约 40% 的提升并适用于"改善实体识别"——把这个数字直接用于实体解析,属于过度外推。

解析依赖多方相互印证,而非单方声明。 单凭一条 sameAs 无法完成解析;只有多个独立来源提供一致的身份信息,才能形成足以支持解析的佐证。这与"标记是声明,不是奖励""靠挣得,不靠标注"含义一致。

八、反模式:身份含混与认错实体

误读为什么看似合理实际问题
「我们到处都被点名,那肯定被解析了」提及次数多,似乎代表权威度高未妥善处理的同名冲突会使模型先验分散到几个同名实体;决定结果的是能否正确解析,不是提及次数
「各渠道用不同名称/账号,做品牌没关系」不同渠道用不同表达,似乎更灵活信息分散到多个候选实体,系统始终无法确定唯一节点
「伪造一条指向知名节点的 sameAs」似乎可以立即建立关联多方信息不一致会使声明失效;造假的解析链接也会被识别
「光靠标记就能解析我们」似乎已提供明确凭据纯 LLM 平台在生成答案时不解析 JSON-LD;显式凭据还要多方一致信息支持
「我们有 Wikipedia 页面,所以被解析了」似乎已具备明确身份Wikipedia 页面只证明节点存在;实体识别还要把具体提及正确对应到这个节点

实体识别失败,几乎从来不是"没有身份",而是认错了对象,或者根本无法确认。解决办法是保持一致,而不是一味增加数量。

九、落地行动清单

  1. 先做同名排查:搜一遍你的品牌名,确认是否存在规模更大的同名实体,评估同名冲突风险。
  2. 部署 sameAs:在 Organization 结构化数据中添加指向 Wikipedia/Wikidata 的 sameAs,并确认全网信息不与声明矛盾。
  3. 统一身份信息:所有渠道使用一致的规范名称与 NAP,避免"实体漂移"“身份坍缩”。
  4. 每次提及附消歧上下文:角色、领域、限定词一起出现,帮引擎区分同名者。
  5. 认领知识图谱节点:建立或认领你的 Wikidata/Google 知识图谱条目,作为解析的目标节点。
  6. 不指望标记万能:纯 LLM 平台生成答案时不解析 JSON-LD——站外一致的提及同样重要。
  7. 别过度外推:Aggarwal 的 +40% 是页内改写结论,不能用于实体解析的 ROI 测算。
  8. 保持一致性优先于数量:身份分裂时,提及越多只会加剧分裂。

十、FAQ

Q1:实体识别不就是个 NLP 细节吗,为什么对 GEO 重要?
因为这一步决定整条链路能否成立。生成式答案署名给的是一个实体,而不是一串字符。如果引擎无法把页面上的名称对应到已知的规范实体,提及、引用或标记带来的信用就无法归属,或者会被归到其他实体名下。实体识别把结构化节点本身(知识图谱存在度)与站外提及信号(品牌提及)联系起来。

Q2:它和知识图谱存在度、品牌提及有什么区别?
三者分工明确。品牌提及关注站外不带链接的提及如何强化模型先验;知识图谱存在度关注结构化节点本身(Wikidata 或 Google 知识图谱中的条目);实体识别则负责把一个名称无歧义地对应到这个节点。提及强化先验,节点提供归属对象,实体识别负责把提及中的名称对应到节点。

Q3:加了 sameAs 标记,实体就一定能被解析吗?
不一定。sameAs 是最强的显式解析凭据(Google 明确说它用于把你的组织与其他组织区分开),但解析依赖多方相互印证,而非单方声明。在纯 LLM 的实时抓取场景,系统生成答案时不会把 JSON-LD 当作知识图谱来解析。孤立的 sameAs 若没有全网一致的身份信息佐证,只能算单方声明,不能完成解析。标记是必要条件,远不是充分条件。

Q4:为什么知名品牌比我更容易被解析?
因为实体能否被可靠解析,取决于佐证是否广泛。长尾知识研究(Kandpal 等,ICML 2023;Mallen 等,ACL 2023)显示,模型对热门实体的回忆与处理远比冷门实体可靠,研究以 Wikipedia 页面浏览量衡量热度。同样的规律也影响消歧:知名实体更容易被准确回忆、提及和正确识别。不过,将这条规律应用于品牌实体只是类比,并不是已测得的品牌结论。

Q5:实体识别最常见的失败是什么?
失败几乎从来不是"没有身份",而是认错了对象,或者根本无法确认。一个未妥善处理的同名冲突(你的品牌和一个更大的实体共用同一串字符),会让相应信用归到规模更大的同名实体名下。名称、账号或 NAP 在各渠道不一致,会使信息分散到多个候选实体,始终无法确定唯一节点。解决办法是保持一致,而不是一味增加数量;身份本就分裂时,提及越多只会加剧分裂。伪造 sameAs 与伪造署名一样,最终都会因缺乏多方相互印证而失效。

参考资料

学术:

  • Kandpal, N., Deng, H., Roberts, A., Wallace, E. & Raffel, C. (2023). Large Language Models Struggle to Learn Long-Tail Knowledge(ICML 2023):https://arxiv.org/abs/2211.08411
  • Mallen, A. et al. (2023). When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories(ACL 2023):https://aclanthology.org/2023.acl-long.546/ · https://arxiv.org/abs/2212.10511
  • Aggarwal, P. et al. (2024). GEO: Generative Engine Optimization(KDD '24,用于界定证据边界;该研究并未度量实体解析):https://arxiv.org/abs/2311.09735

官方:

  • Google — Introducing the Knowledge Graph: things, not strings(2012,奠定"实体,而非字符串"模型):https://blog.google/products-and-platforms/products/search/introducing-knowledge-graph-things-not/
  • Google Search Central — Organization structured data(sameAs"在后台用于把你的组织与其他组织区分开"):https://developers.google.com/search/docs/appearance/structured-data/organization
  • Schema.org — sameAs(“无歧义地标明该项身份的参考网页 URL”):https://schema.org/sameAs

业界:

  • Search Engine Land — Why entity authority is the foundation of AI search visibility(Benu Aggarwal,2026):https://searchengineland.com/entity-authority-ai-search-visibility-471619

本文围绕实体识别的定义、解析流程、三类输入、平台差异与反模式撰写,核心判断均可在上述论文、官方文档与业界文章中追溯。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐