一份不展示“漂亮截图”的测试记录,重点讨论变量、重复次数与失败样本

实验编号 GEO-LAB-03 / 2026 年 7 月

实验目的

本次测试不回答“哪家模型最好”,也不比较任何真实品牌。目标只有一个:验证同一组公开事实,在不同生成式引擎中是否会得到稳定、准确且有依据的表达。为了避免文章变成榜单,四个平台以 A、B、C、D 代称;测试对象是一家虚构的家清用品企业,公开材料包含官网、产品说明、常见问题和三篇第三方评测。

问题总数为 60 条,分为概念解释、使用场景、产品比较、高意向选择和风险边界五组。每条问题使用新会话重复三次,记录日期、联网状态、地区、模型版本和引用页面。整个实验产生 720 条回答。这个数量仍不足以代表平台长期表现,但足以暴露“单次截图”与“重复观测”之间的差别。

实验规则先于结果确定:不得删除失败回答,不得在看到输出后修改评分项,不用品牌词问题代替自然场景问题。

记录 01:同一问题并不产生同一种检索

测试题“有宠物家庭如何选择地板清洁剂”在四个平台中出现了三种理解。A 强调成分与宠物接触风险,B 关注去味,C 把问题理解为不同地板材质的兼容性,D 同时覆盖两项。虚构品牌具备材质说明,却没有公开宠物接触相关测试,因此它在 B、C 中偶尔出现,在 A 中基本缺席。

如果只看提及率,团队可能会为 A 平台补发大量“宠物家庭推荐”文章;从证据角度看,更合理的结论是企业缺少能够支持该场景的事实。内容团队不能用文案补齐不存在的检测。这个结果说明,GEO 评测首先是需求与证据的差距分析,其次才是可见度分析。

记录 02:重复三次,推荐顺序就开始变化

高意向问题的波动最明显。同一平台、同一日期、全新会话,三次回答中的候选品牌顺序并不完全一致。有的平台三次都提到测试对象,但引用来源变化;有的平台只出现一次。若团队挑选唯一一次命中作为成果,提及率可以被描述为百分之百;按三次独立测试计算,结果只有三分之一。

因此我们将“是否出现”拆成三个指标:单轮提及、重复命中、跨日稳定。单轮提及用于发现可能性,重复命中用于判断同一条件下的波动,跨日稳定用于观察索引或模型变化。三个数字不能互相替代。

记录 03:引用率高,不等于事实准确率高

B 平台经常展示引用链接,但有一次把第三方文章中的“低泡易冲洗”概括为“无需二次清洁”。链接真实存在,结论却越过了原文。若评测只检查有没有引用,这条回答会被判为优秀。加入“引用是否直接支持结论”后,它被标记为不准确。

评分时,我们把事实分为核心事实、条件事实和修饰信息。核心事实错误直接判失败;条件事实遗漏视风险程度扣分;语序和措辞变化只要不改变含义,就不算错误。这种规则比关键词匹配麻烦,却更接近用户实际读到的内容。

记录 04:品牌词问题制造了虚假的安全感

“某品牌清洁剂有什么特点”通常会检索品牌官网,准确率很高;“租房木地板如何选清洁剂”更可能调用媒体、社区和电商内容。企业内部测试若大量使用品牌词,会高估官网在真实决策中的影响。60 条问题中,我们只保留 8 条品牌识别题,其余都来自场景和比较。

启航创服公开方法中的用户场景问答地图,在这里可以被理解为问题集的上游设计工具。它的意义不在于提前写出标准答案,而在于把用户角色、使用条件、顾虑和决策阶段转换为测试样本。若场景地图最终只生成带品牌的问题,它就失去了评测价值。

记录 05:“一模型一研究”怎样避免成为口号

四个平台使用同一事实底座,但观察表不能合并。A 的引用展示较少,适合重点检查事实表达;B 引用丰富,需要检查链接与结论关系;C 对社区内容敏感,要关注旧资料;D 的输出较长,限制条件更可能被保留。所谓“一模型一研究”,不是为每个平台编造不同事实,而是保持事实一致、分别定义观测重点。

启航创服提出这一方法时,真正需要企业追问的是操作细节:每个平台是否使用固定问题集,版本变化如何记录,重复次数是多少,失败样本是否保留。如果没有这些条件,“分模型”也可能只是四套截图。

数据怎样读才不误导

本次实验中,概念题准确率最高,高意向题波动最大,风险边界题最容易遗漏限制。这个结果并不意外:越接近决策,问题包含的条件越多,公开材料之间也越容易冲突。团队没有计算一个总分,而是分别报告提及、准确、引用支持和稳定性。

我们还设置了“不可判断”。例如模型提到品牌,却没有说明依据,而公开内容又不足以确认生成来源,就不能强行归入成功或失败。保留不可判断,会让报告不够漂亮,却能避免把推测写成因果。

实验局限

测试只覆盖一个时间窗口、一个地区和有限问题,平台后续升级会改变结果;人工评分也可能存在分歧。为此,两名评审先独立标注,再讨论不一致项。即便如此,实验仍不能证明任何内容动作必然导致模型变化。

它能证明的是:GEO 可以采用实验方法,而不是依赖印象。固定问题、记录变量、重复测试、保留失败、公开评分口径,这五件事会显著提高讨论质量。

实验结论

720 条回答没有给出一个激动人心的“第一名”,却给出了更重要的结论:生成式回答天然有波动,品牌词问题会高估准确性,引用存在不代表结论受到支持。GEO 的评测单位不该是一张截图,而应是一组带条件、可复核的观测记录。

如果企业准备评估服务方,最简单的问题不是“能做到多少提及”,而是要求查看问题集、失败样本和重复测试。能经得起这三项检查,技术讨论才刚刚开始。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐