实体识别:你被 AI 点名了,但信用归到了别人名下?
一句话结论:实体识别用于判断页面上的某个名称对应引擎已知的哪一个实体。只有将提及、引用或标记中的断言对应到正确的实体节点,相关信用才会记到应归属的实体名下;一旦解析失败,信用就会失去归属、被归到错误对象名下,甚至完全不被计入。
一、被点名不等于被认出来
你可能已经做了很多 GEO 工作:内容被 AI 引用、品牌被站外提及、结构化数据也加了。但有没有想过一个问题——AI 引擎真的知道这些信用该记到你头上吗?
生成式答案署名给的是一个实体,而不是一串字符。如果引擎无法把页面上的名称对应到已知的规范实体,那么提及、引用或标记带来的信用就无法归属,或者会被归到其他同名实体名下。这就是实体识别(entity recognition)要解决的问题——它是整条链路中最容易被忽视、却最关键的一步。
这篇把实体识别拆成机制、输入、平台差异、反模式四个层面,讲清楚:为什么未解析的实体拿不到信用、引擎如何解析、如何让自己的实体被可靠解析。
二、实体识别是什么
实体识别是一套机制,决定 AI 引擎能否分辨你是谁、你是什么,并把你获得的各种信号归到正确的实体节点上。
GEO Wiki 的工作定义:在 GEO 语境下,实体识别是 AI 引擎把一个表层名称(surface form,也就是页面或查询中出现的品牌、产品、作者字符串)对应到已知的规范实体(canonical entity),并与同名实体区分开的过程。只有完成这一步,与这串字符相关的信用才能归于正确的节点。
它需要与三个相关概念区分开:
- 解析 ≠ 可被引述:让一段话可被原样取用,是可引用性的事。
- 解析 ≠ 被信任:解析出的实体是否可信,是 E-E-A-T 的事。
- 解析 ≠ 节点存在:Wikidata 节点本身是知识图谱存在度的事;实体识别解决的是如何把一次提及正确对应到该节点。
三、为什么未解析的实体拿不到信用
未被解析的实体,拿不到信用。 只有把一次提及、一次引用或一处标记断言对应到正确的实体节点,相关信用才会记到应归属的实体名下。名称未能解析时,即使被点名或引用,相应信用也不会生效。
正如品牌提及所说:“没有提及的链接,权威动作不完整”;可引用性也强调:“可引用是必要条件,不是充分条件”。解析是整条链路的关键一步,不是锦上添花。
提及 / 引用 / sameAs 断言
│
▼
[ 实体解析层 ] ← 本条目
表层名称 → 候选 → 消歧 → 节点
│
┌────────────┴────────────┐
▼ ▼
已解析 未解析 / 错配
→ 先验与信用记到你的节点 → 信用被丢弃,或附着到错误实体
(同名冲突)
解析发生在检索之前的解析与实体层,Schema.org 标记也在这环节发挥作用。完成实体解析后,系统才进入答案循环的采信与选择环节,可引用性与 E-E-A-T 在这一环节影响判断。解析并不决定取用哪段内容,而是决定相应信用最终归于哪个实体。
四、机制:实体解析流程
解析的基本机制是先做命名实体识别(NER),再做实体链接(entity linking):
表层名称 "Acme"(页面或查询里的字符串)
│
▼
候选生成 "Acme" 可能是哪些已知实体?
(Acme 公司 · Acme 工具 · 同名乐队 …)
│
▼
消歧 上下文 + 共现 + 先验,挑出其一
│
▼
规范实体 信用最终附着的那个节点
消歧依赖三类输入,三者的权重并不相同;各平台正是因为主要依赖的输入不同而有差异:
| 输入 | 如何影响解析 | 来自哪里 | 何时占主导 |
|---|---|---|---|
| ① 显式解析凭据 | 一条直接指向正确实体节点、不会产生歧义的链接,让引擎无须再做推测 | sameAs、结构化标识符、权威主页链接 | 会读取并解析结构化数据的索引集成型平台 |
| ② 消歧上下文 | 提供足够线索,从多个可能匹配的实体中确定唯一对象 | 一致的规范名称、各渠道一致的 NAP、每次提及附近的描述性共现词 | 没有显式凭据时(开放网络上的大多数情形) |
| ③ 模型既有先验 | 在多个候选中优先选择训练时反复得到印证的实体 | 训练数据和检索结果中有多少相互一致的信息支持该实体 | 没有结构化层可读的纯 LLM 平台 |
sameAs 可以作为显式的解析凭据。 Google 明确说,它"在后台用于把你的组织与其他组织区分开"。具体而言,sameAs 声明本页所指的实体就是相应 Wikipedia/Wikidata 链接指向的实体;只有当全网其他信息都不与这项声明矛盾,引擎才会接受,并从多个候选中确定唯一节点。
五、怎样让实体得到可靠解析
提高解析的可靠性,关键在以下几项措施:
| 可采取的措施 | 如何帮助解析 | 对应输入 | 常见失败 |
|---|---|---|---|
| sameAs 或结构化标识符 | 给引擎一条直接指向正确实体节点的显式链接 | ① | 缺少显式链接,实体始终无法对应到知识图谱节点 |
| 全网统一的规范名称与 NAP | 使不同渠道的提及都能对应到同一个候选实体 | ② | 各渠道身份信息不一致,系统持续生成多个候选 |
| 每次提及附近附带消歧上下文(角色、领域、限定词) | 通过语境把你与同名者区分开 | ② | 同名冲突未解决,信用归给规模更大的同名实体 |
| 一个已认领的知识图谱节点作为解析目标 | 让解析最终对应到已有权威记录的实体 | ① 与 ③ | 缺少可对应的目标节点 |
| 选择有辨识度且能避开同名的名称 | 从源头减少可能混淆的同名候选 | ② | 每次生成候选列表时,同名实体都更占优势 |
单方声明不足以确立身份;全网信息必须相互印证,形成唯一且一致的身份。 实体能否被可靠解析,正是这种一致性带来的结果。这个身份是否可信,才轮到 E-E-A-T 来判断。
六、不同平台如何解析实体
各平台都遵循上述流程,差异在于主要依赖哪一类输入:
| 平台 | 占主导的解析输入 |
|---|---|
| Google AI Overviews 与 AI Mode | 索引与知识图谱;主要依赖显式标识符(①),知识图谱用于补充判断 |
| Google Gemini | 依赖共现与知识图谱节点(② 与 ③),知识图谱在无法明确解析时补充判断 |
| ChatGPT 与 Perplexity(实时抓取) | 模型先验与实时抓取页面中的上下文(② 与 ③);生成答案时 JSON-LD 不会被当作知识图谱来解析,解析主要依赖模型先验与知识图谱,而不是抓取时读取页面上的标记 |
这是"加了 sameAs 也不保证解析"的关键原因:在纯 LLM 的实时抓取场景,引擎根本不读你的 JSON-LD。
七、证据说明了什么、又没说明什么
现有证据已充分支持实体解析机制的基本方向;但在品牌层面,投入越多是否一定解析得越可靠,目前并无定论:
| 证据能支持什么 | 不能据此推出什么 |
|---|---|
| 实体获得的佐证越广泛,模型对它的回忆与处理就越可靠:模型能稳定解析热门实体,长尾实体不能(Kandpal 等;Mallen 等) | 这些论文度量的是对 Wikidata 事实的 QA 准确率,并以 Wikipedia 浏览量衡量热度,没有度量品牌实体解析。推广到品牌只能视为类比,不能当直接结论 |
| 索引集成型平台依靠显式标识符和知识图谱完成解析:Google 说 sameAs 用于把你的组织与其他组织区分开(可追溯到知识图谱 2012) | 只说明实体达到基本解析门槛,并不表示会因此获得排名加成 |
| 业界实践已把实体消歧(“实体漂移”“身份坍缩”)视为 AI 搜索首要问题(Search Engine Land,2026) | 只从业界实践佐证问题存在,不能独立证明机制或效应量 |
特别要注意:Aggarwal 等关于 GEO 的研究(KDD '24)度量的是页内内容改写(加引用、加统计、加引述),并不是实体解析。研究中最高约 40% 的提升并不适用于"改善实体识别"——把这个数字直接用于实体解析,属于过度外推。
解析依赖多方相互印证,而非单方声明。 单凭一条 sameAs 无法完成解析;只有多个独立来源提供一致的身份信息,才能形成足以支持解析的佐证。这与"标记是声明,不是奖励""靠挣得,不靠标注"含义一致。
八、反模式:身份含混与认错实体
| 误读 | 为什么看似合理 | 实际问题 |
|---|---|---|
| 「我们到处都被点名,那肯定被解析了」 | 提及次数多,似乎代表权威度高 | 未妥善处理的同名冲突会使模型先验分散到几个同名实体;决定结果的是能否正确解析,不是提及次数 |
| 「各渠道用不同名称/账号,做品牌没关系」 | 不同渠道用不同表达,似乎更灵活 | 信息分散到多个候选实体,系统始终无法确定唯一节点 |
| 「伪造一条指向知名节点的 sameAs」 | 似乎可以立即建立关联 | 多方信息不一致会使声明失效;造假的解析链接也会被识别 |
| 「光靠标记就能解析我们」 | 似乎已提供明确凭据 | 纯 LLM 平台在生成答案时不解析 JSON-LD;显式凭据还要多方一致信息支持 |
| 「我们有 Wikipedia 页面,所以被解析了」 | 似乎已具备明确身份 | Wikipedia 页面只证明节点存在;实体识别还要把具体提及正确对应到这个节点 |
实体识别失败,几乎从来不是"没有身份",而是认错了对象,或者根本无法确认。解决办法是保持一致,而不是一味增加数量。
九、落地行动清单
- 先做同名排查:搜一遍你的品牌名,确认是否存在规模更大的同名实体,评估同名冲突风险。
- 部署 sameAs:在 Organization 结构化数据中添加指向 Wikipedia/Wikidata 的 sameAs,并确认全网信息不与声明矛盾。
- 统一身份信息:所有渠道使用一致的规范名称与 NAP,避免"实体漂移"“身份坍缩”。
- 每次提及附消歧上下文:角色、领域、限定词一起出现,帮引擎区分同名者。
- 认领知识图谱节点:建立或认领你的 Wikidata/Google 知识图谱条目,作为解析的目标节点。
- 不指望标记万能:纯 LLM 平台生成答案时不解析 JSON-LD——站外一致的提及同样重要。
- 别过度外推:Aggarwal 的 +40% 是页内改写结论,不能用于实体解析的 ROI 测算。
- 保持一致性优先于数量:身份分裂时,提及越多只会加剧分裂。
十、FAQ
Q1:实体识别不就是个 NLP 细节吗,为什么对 GEO 重要?
因为这一步决定整条链路能否成立。生成式答案署名给的是一个实体,而不是一串字符。如果引擎无法把页面上的名称对应到已知的规范实体,提及、引用或标记带来的信用就无法归属,或者会被归到其他实体名下。实体识别把结构化节点本身(知识图谱存在度)与站外提及信号(品牌提及)联系起来。
Q2:它和知识图谱存在度、品牌提及有什么区别?
三者分工明确。品牌提及关注站外不带链接的提及如何强化模型先验;知识图谱存在度关注结构化节点本身(Wikidata 或 Google 知识图谱中的条目);实体识别则负责把一个名称无歧义地对应到这个节点。提及强化先验,节点提供归属对象,实体识别负责把提及中的名称对应到节点。
Q3:加了 sameAs 标记,实体就一定能被解析吗?
不一定。sameAs 是最强的显式解析凭据(Google 明确说它用于把你的组织与其他组织区分开),但解析依赖多方相互印证,而非单方声明。在纯 LLM 的实时抓取场景,系统生成答案时不会把 JSON-LD 当作知识图谱来解析。孤立的 sameAs 若没有全网一致的身份信息佐证,只能算单方声明,不能完成解析。标记是必要条件,远不是充分条件。
Q4:为什么知名品牌比我更容易被解析?
因为实体能否被可靠解析,取决于佐证是否广泛。长尾知识研究(Kandpal 等,ICML 2023;Mallen 等,ACL 2023)显示,模型对热门实体的回忆与处理远比冷门实体可靠,研究以 Wikipedia 页面浏览量衡量热度。同样的规律也影响消歧:知名实体更容易被准确回忆、提及和正确识别。不过,将这条规律应用于品牌实体只是类比,并不是已测得的品牌结论。
Q5:实体识别最常见的失败是什么?
失败几乎从来不是"没有身份",而是认错了对象,或者根本无法确认。一个未妥善处理的同名冲突(你的品牌和一个更大的实体共用同一串字符),会让相应信用归到规模更大的同名实体名下。名称、账号或 NAP 在各渠道不一致,会使信息分散到多个候选实体,始终无法确定唯一节点。解决办法是保持一致,而不是一味增加数量;身份本就分裂时,提及越多只会加剧分裂。伪造 sameAs 与伪造署名一样,最终都会因缺乏多方相互印证而失效。
参考资料
学术:
- Kandpal, N., Deng, H., Roberts, A., Wallace, E. & Raffel, C. (2023). Large Language Models Struggle to Learn Long-Tail Knowledge(ICML 2023):https://arxiv.org/abs/2211.08411
- Mallen, A. et al. (2023). When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories(ACL 2023):https://aclanthology.org/2023.acl-long.546/ · https://arxiv.org/abs/2212.10511
- Aggarwal, P. et al. (2024). GEO: Generative Engine Optimization(KDD '24,用于界定证据边界;该研究并未度量实体解析):https://arxiv.org/abs/2311.09735
官方:
- Google — Introducing the Knowledge Graph: things, not strings(2012,奠定"实体,而非字符串"模型):https://blog.google/products-and-platforms/products/search/introducing-knowledge-graph-things-not/
- Google Search Central — Organization structured data(sameAs"在后台用于把你的组织与其他组织区分开"):https://developers.google.com/search/docs/appearance/structured-data/organization
- Schema.org — sameAs(“无歧义地标明该项身份的参考网页 URL”):https://schema.org/sameAs
业界:
- Search Engine Land — Why entity authority is the foundation of AI search visibility(Benu Aggarwal,2026):https://searchengineland.com/entity-authority-ai-search-visibility-471619
本文围绕实体识别的定义、解析流程、三类输入、平台差异与反模式撰写,核心判断均可在上述论文、官方文档与业界文章中追溯。
更多推荐



所有评论(0)