最近,绿雪智能科技旗下“AI心智指数”网站发布了《2026毕业旅行运动鞋品牌AI心智指数报告》。

这份报告基于6个主流AI平台,包括豆包、DeepSeek、通义千问、Kimi、文心一言、腾讯元宝,围绕“毕业旅行运动鞋”这一细分消费场景进行了3600次独立提问采集。每个平台600次采集,并在后续处理中进行有效样本识别和无效回答剔除,因此最终有效样本低于3600次。

从结果看,新百伦综合得分第一,耐克提及率最高,阿迪达斯位列第三,李宁、安踏进入前五,萨洛蒙、亚瑟士、Hoka One One、迈乐等功能型和户外型品牌也进入榜单。

如果只把它看成一份运动鞋品牌榜单,价值并不完整。

从技术角度看,这份报告真正有意思的地方在于:它展示了一种新的品牌评价方式——不是基于销量、搜索量、投票量或电商评论,而是基于生成式AI回答中的品牌呈现结果,对品牌在AI系统中的“被想起、被推荐、被解释”能力进行量化。

这背后涉及一整套技术问题:

  • 如何设计覆盖真实用户意图的问题集?
  • 如何在多个AI平台上稳定采集回答?
  • 如何识别回答中的品牌实体?
  • 如何区分“提及”和“推荐”?
  • 如何处理品牌别名、英文名、中文名和同义表达?
  • 如何计算提及率、推荐率和综合得分?
  • 如何避免AI回答中的噪声、幻觉和无效样本影响结果?
  • 如何把结果转化为品牌GEO优化建议?

本文尝试从技术视角拆解这份报告背后的方法论。


1. 这份报告本质上不是“鞋榜”,而是一个AI回答观测系统

传统品牌排行榜通常依赖几类数据:

类型 数据来源
销量榜 电商平台、渠道销售、企业披露
声量榜 社交媒体、搜索指数、媒体曝光
口碑榜 评论、评分、用户调研
影响力榜 品牌资产、广告投放、市场份额

而《2026毕业旅行运动鞋品牌AI心智指数报告》观察的是另一类数据:

生成式AI回答数据。

也就是说,它不是统计用户买了什么,也不是统计用户搜索了什么,而是统计:

当用户向AI提出真实消费问题时,AI回答里出现了哪些品牌?
哪些品牌只是被提到?
哪些品牌被AI明确推荐?
哪些品牌被AI放进具体场景中解释?

这类数据可以被理解为一种“AI输出层观测数据”。

在搜索时代,我们关心的是:

用户搜索关键词 -> 搜索引擎返回网页 -> 用户点击结果

在AI时代,链路变成:

用户提出场景化问题 -> AI生成综合答案 -> 用户参考AI建议

这意味着,品牌评价对象从“网页排名”变成了“答案位置”。

这就是AI心智指数的技术意义。

它观察的不是品牌在传统互联网里的位置,而是品牌在AI回答生成结果里的位置。


2. 问题集设计:为什么不能只问“运动鞋品牌排行榜”?

这类报告最关键的第一步,不是模型调用,而是问题集设计。

如果只问:

运动鞋品牌排行榜有哪些?

得到的结果会非常泛化,大概率会集中在耐克、阿迪达斯、彪马、New Balance、李宁、安踏等传统高认知品牌上。

但真实用户不会总是这样提问。

真实用户更可能问:

毕业旅行穿什么运动鞋比较舒服?
学生党毕业旅行买什么运动鞋合适?
去重庆旅行爬坡多,穿什么鞋不累?
准大学生暑假旅行,想买一双开学也能穿的运动鞋,怎么选?
女生毕业旅行想买舒适又百搭的运动鞋,有哪些品牌?
长时间走路不累的运动鞋品牌有哪些?
预算有限,国货运动鞋适合毕业旅行吗?

这类问题有几个特点:

第一,它不是关键词,而是场景。

第二,它包含人群约束,比如学生党、准大学生、女生、男生。

第三,它包含功能需求,比如舒适、耐走、防滑、缓震、百搭。

第四,它包含地点暗示,比如重庆、成都、西安、云南等毕业旅行常见目的地。

第五,它包含预算和后续使用场景,比如开学后还能穿、日常通勤也能用。

所以,在技术实现中,问题集不能只是简单关键词扩展,而要覆盖多个维度:

品类维度:运动鞋、旅行鞋、跑鞋、徒步鞋
人群维度:高考生、准大学生、学生党、女生、男生
场景维度:毕业旅行、城市漫游、轻户外、校园生活
功能维度:舒适、耐走、防滑、缓震、百搭
预算维度:平价、性价比、学生预算
地点维度:重庆、成都、西安、云南、长沙、青岛等

可以抽象成一个问题生成矩阵:

Question = 人群 + 场景 + 品类 + 功能需求 + 约束条件

示例:

准大学生 + 毕业旅行 + 运动鞋 + 长时间走路不累 + 学生预算

生成问题:

准大学生毕业旅行,预算有限,想买一双长时间走路不累的运动鞋,有哪些品牌可以参考?

这种问题集设计,比单纯问“品牌排行榜”更接近真实AI使用场景。


3. 多平台采集:为什么必须跨多个AI平台?

报告覆盖了6个AI平台:

  • 豆包
  • DeepSeek
  • 通义千问
  • Kimi
  • 文心一言
  • 腾讯元宝

每个平台600次独立提问,共3600次采集。

从技术角度看,多平台采集很重要,因为不同AI平台的回答存在差异:

差异类型 表现
训练语料差异 不同模型对品牌、产品、平台信息的熟悉程度不同
对齐策略差异 有的平台更谨慎,有的平台更愿意给明确推荐
回答风格差异 有的平台喜欢列清单,有的平台喜欢解释原则
中文品牌识别差异 对国货品牌、英文品牌、别名的识别能力不同
场景理解差异 对毕业旅行、学生党、轻户外等语义的理解不同

如果只采集一个平台,结果可能受单一模型偏好影响。

跨平台采集的意义在于降低单模型偏差,更接近“生成式AI生态中的整体表现”。

一个简化的采集流程可以表示为:

问题集生成
    ↓
按平台分发任务
    ↓
调用各AI平台
    ↓
保存原始回答
    ↓
清洗无效回答
    ↓
品牌实体识别
    ↓
推荐意图识别
    ↓
指标计算
    ↓
榜单输出

工程上,这类采集系统通常需要考虑:

  • 并发控制
  • 失败重试
  • 请求限速
  • 平台异常处理
  • 原始回答留存
  • 任务状态追踪
  • 采集结果可复核
  • 不同平台回答格式统一化

如果是生产系统,不建议只保存最终统计结果。更合理的是保存完整链路:

question_id
platform
prompt_text
raw_answer
normalized_answer
mentioned_brands
recommended_brands
is_valid
created_at

这样后续可以回溯每一个品牌为什么被计数。


4. 品牌实体识别:最容易被低估的技术难点

这类报告最大的技术难点之一,是品牌实体识别。

看起来只是统计品牌出现次数,但真实情况很复杂。

以新百伦为例,AI回答中可能出现:

新百伦
New Balance
NB
new balance
NewBalance

以 Hoka One One 为例,可能出现:

Hoka
HOKA
Hoka One One
霍卡
厚底跑鞋Hoka

以萨洛蒙为例,可能出现:

萨洛蒙
Salomon
所罗门
萨洛蒙户外鞋

如果不做实体归一,榜单会被拆散。

例如:

New Balance 800次
新百伦 600次
NB 183次

如果系统不合并,就会把同一个品牌算成多个品牌,导致排名失真。

所以,品牌实体识别至少需要三层处理:

4.1 品牌词典

建立标准品牌库:

{
  "brand_id": "new_balance",
  "canonical_name": "新百伦",
  "aliases": ["New Balance", "NB", "new balance", "NewBalance"]
}

4.2 模糊匹配

处理大小写、空格、标点、翻译差异。

def normalize_text(text: str) -> str:
    return (
        text.lower()
            .replace(" ", "")
            .replace("-", "")
            .replace("_", "")
    )

4.3 上下文消歧

有些缩写可能存在歧义。例如“NB”在中文语境里可能不是品牌,而是口语表达。因此不能只要出现“NB”就计入新百伦,需要结合上下文判断:

推荐NB的327、574系列

这种可以判定为品牌。

但如果出现:

这双鞋真的很NB

就不能算作品牌提及。

所以较稳妥的技术方案是:

词典匹配 + 正则规则 + LLM辅助校验 + 人工抽检

这也是品牌AI心智测评系统能否可信的关键。


5. “提及”和“推荐”不是一回事:推荐意图识别更难

报告中有两个关键指标:

  • 提及率
  • 推荐率

提及相对容易判断:

这类鞋可以看看耐克、阿迪达斯、新百伦、李宁、安踏。

这里多个品牌都被提及。

但推荐更复杂。

例如:

如果更看重舒适和百搭,新百伦会更适合毕业旅行。

这是推荐。

耐克和阿迪达斯知名度高,但有些鞋款长时间走路未必最舒服。

这里虽然提到了耐克和阿迪达斯,但不一定是正向推荐。

不建议只为了潮流选择厚重鞋款。

如果后文关联某品牌,还可能是负向判断。

所以推荐识别不能只看品牌是否出现,而要识别语义角色。

可以把品牌在回答中的状态分成几类:

状态 含义
mentioned 被提到
recommended 被明确推荐
compared 被比较
cautioned 被提醒谨慎
negative 被负面评价
neutral 中性出现

一个简化的推荐识别规则可以是:

品牌附近出现“推荐、适合、可以选择、优先考虑、值得看、比较合适”等动词或短语

但仅靠规则不够。

更稳妥的方法是让模型对每段回答做结构化抽取:

{
  "brands": [
    {
      "name": "新百伦",
      "mentioned": true,
      "recommended": true,
      "reason": "舒适、百搭、适合城市步行"
    },
    {
      "name": "耐克",
      "mentioned": true,
      "recommended": true,
      "reason": "款式多、年轻人熟悉"
    },
    {
      "name": "阿迪达斯",
      "mentioned": true,
      "recommended": false,
      "reason": "被作为知名品牌提及,但未明确推荐"
    }
  ]
}

当然,LLM抽取也会有误差,所以生产级系统一般要叠加校验:

规则初筛 -> LLM结构化抽取 -> 置信度判断 -> 异常样本抽检

推荐率的技术含义其实比提及率更深。

提及率回答的是:

AI知道谁?

推荐率回答的是:

AI认为谁适合这个问题?

这就是为什么报告中耐克提及率最高,但新百伦综合得分第一。


6. 指标建模:综合得分不应该只是简单平均

报告中使用了综合得分、提及率、推荐率、提及次数、推荐次数。

以公开数据看:

品牌 综合得分 提及率 推荐率
新百伦 81.59 88.26% 78.00%
耐克 78.59 91.36% 71.72%
阿迪达斯 74.20 89.42% 66.00%
李宁 63.67 63.18% 63.94%
安踏 59.67 60.72% 59.11%

从结果看,综合得分不是简单等同于提及率,也不是简单等同于推荐率,而是综合了多个维度。

在技术上,综合得分通常可以考虑以下因素:

综合得分 = f(提及率, 推荐率, 平台覆盖度, 问题覆盖度, 场景解释度, 稳定性)

一个简化模型可以写成:

score = w1 * mention_rate
      + w2 * recommend_rate
      + w3 * platform_coverage
      + w4 * scenario_coverage
      + w5 * explanation_quality

其中:

  • mention_rate:品牌被AI想起的能力
  • recommend_rate:品牌被AI推荐的能力
  • platform_coverage:品牌是否只在某个平台强,还是多平台稳定
  • scenario_coverage:品牌是否只在单一问题中出现,还是在多个场景中出现
  • explanation_quality:AI是否能说清楚推荐理由

公开报告没有披露完整公式,因此不能反推具体权重。但从结果看,新百伦综合得分第一,说明推荐率和场景适配度在评估中具有较高权重。

这是合理的。

因为AI心智指数不是传统知名度指数。只被AI提到但不被推荐,说明品牌有认知,但不一定能转化成AI建议。

在AI问答场景中,“推荐”比“提及”更接近用户决策入口。


7. 为什么新百伦综合第一?从技术角度看,是“场景匹配分”更高

从结果看,耐克提及率最高,为91.36%;阿迪达斯提及率为89.42%;新百伦提及率为88.26%。

三者都很高。

但新百伦推荐率最高,为78.00%。

这说明在模型回答中,新百伦更容易从品牌候选集合进入建议集合。

从技术角度看,可以理解为:

品牌候选召回:耐克、阿迪达斯、新百伦都很强
场景推荐排序:新百伦在毕业旅行语境中更靠前

这很像搜索和推荐系统里的两阶段架构:

Recall 阶段:召回候选品牌
Ranking 阶段:根据场景进行排序

如果把AI回答看成一个隐式推荐系统:

  • 提及率接近召回能力
  • 推荐率接近排序后的输出能力
  • 综合得分接近最终答案位置价值

新百伦的优势不是召回压倒性领先,而是在排序阶段更适合“毕业旅行运动鞋”这个query intent。

原因在于它的语义标签更贴合:

舒适
百搭
复古
城市步行
日常穿搭
学生可接受
旅行和校园都能用

这些标签和用户问题之间的相似度高。

如果用向量检索的语言解释,可以理解为:

embedding("毕业旅行 运动鞋 舒适 百搭 长时间走路 学生")

与新百伦相关内容的语义距离,可能比与纯竞技、专业运动、潮流篮球等内容更近。

当然,真实AI模型不是简单向量匹配,但这个类比有助于理解:

AI推荐品牌时,本质上会受到品牌公开内容、语义标签、场景关联和回答模板的共同影响。


8. 国货品牌进入前五:说明AI推荐不是单纯“国际品牌优先”

李宁和安踏进入前五,是这份报告中比较积极的技术信号。

这说明在“学生党、准大学生、预算、国货、校园运动”等问题中,AI会形成国产品牌候选集。

从AI系统角度看,品牌能否进入回答,取决于多个因素:

品牌知名度
公开内容规模
场景内容丰富度
语义标签清晰度
用户问题匹配度
模型对该品牌的知识稳定性

李宁、安踏的优势在于,它们具备比较清晰的AI标签:

国货
性价比
学生党
运动基础款
校园生活
日常运动
年轻人

这些标签刚好匹配毕业旅行运动鞋问题中的部分高频约束。

这说明一个重要现象:

AI不一定只推荐最大牌,而是会在具体约束下推荐更适配的品牌。

对国产品牌来说,这提供了GEO优化机会。

不要只做宏大品牌叙事,也要做足够细的场景内容:

适合准大学生的运动鞋
适合毕业旅行的国产运动鞋
学生党平价运动鞋
长时间步行不累的国货运动鞋
大学校园日常穿搭运动鞋
城市旅行运动鞋选择指南

这些内容越清晰,AI越容易在相关问题中建立品牌和场景的连接。


9. 功能型品牌上榜:说明AI正在识别“长走场景”

萨洛蒙、亚瑟士、Hoka One One、迈乐上榜,也是一个值得技术分析的现象。

它说明AI并没有把“毕业旅行运动鞋”简单理解为“运动鞋品牌”,而是进一步识别了场景背后的功能需求:

长时间步行
缓震
支撑
防滑
轻户外
徒步
城市漫游
旅行舒适度

这类需求会把AI的推荐空间从传统运动品牌扩展到功能型品牌、户外品牌和跑鞋品牌。

这体现了AI问答和传统搜索的差异。

传统搜索中,用户如果搜索“运动鞋品牌”,结果会偏品类通用。

但在AI问答中,只要用户问题包含“毕业旅行”“走路不累”“重庆爬坡”“云南旅行”等场景信息,AI就可能进行隐式需求解析。

可以抽象为:

用户问题:毕业旅行穿什么运动鞋?
隐含需求:长时间步行 + 舒适 + 百搭 + 学生预算
候选品牌:运动品牌 + 跑鞋品牌 + 户外品牌 + 国货品牌

这对功能型品牌非常有利。

过去它们可能主要在专业圈层中被讨论;现在,通过AI场景理解,它们有机会进入更大众的问题答案中。


10. 从SEO到GEO:品牌内容正在进入机器可理解时代

这份报告背后最值得技术人关注的,是GEO。

SEO关注的是:

网页能不能被搜索引擎收录、排名和点击

GEO关注的是:

品牌能不能被生成式AI理解、引用、提及和推荐

二者底层目标不同。

SEO时代,页面优化经常关注:

  • 标题
  • 关键词
  • 外链
  • 页面结构
  • 收录
  • 点击率
  • 排名

GEO时代,品牌更需要关注:

  • 实体识别是否清晰
  • 品牌别名是否统一
  • 场景内容是否具体
  • 产品优势是否可解释
  • 权威信息源是否完整
  • AI是否能稳定抽取品牌价值
  • 品牌是否与真实用户问题建立连接

技术上,可以把GEO拆成四层:

Entity Layer:品牌实体层
Content Layer:内容语义层
Scenario Layer:场景匹配层
Answer Layer:AI回答呈现层

对应到品牌建设:

技术层 品牌侧任务
Entity Layer 统一品牌名称、别名、官网、百科、产品线
Content Layer 建立清晰、稳定、可机器理解的内容
Scenario Layer 覆盖真实用户问题和具体生活场景
Answer Layer 监测AI是否提及、推荐、解释品牌

AI心智指数的价值,就在于它不是只看内容有没有发布,而是直接观察最终AI回答。

这比传统SEO监控更靠近用户接触点。


11. 一个可参考的AI品牌心智分析架构

如果要从工程角度搭建类似系统,可以分成八个模块。

11.1 品类与场景配置模块

{
  "category": "毕业旅行运动鞋",
  "target_audience": ["高考生", "准大学生", "学生党"],
  "scenarios": ["毕业旅行", "城市漫游", "轻户外", "校园生活"],
  "requirements": ["舒适", "长时间步行", "百搭", "平价", "国货"]
}

11.2 问题生成模块

根据品类、场景、人群和功能需求组合问题。

audiences = ["高考生", "准大学生", "学生党"]
scenarios = ["毕业旅行", "暑假旅行", "城市旅行"]
requirements = ["长时间走路不累", "舒适百搭", "预算有限"]

questions = []

for a in audiences:
    for s in scenarios:
        for r in requirements:
            questions.append(f"{a}{s}想买一双{r}的运动鞋,有哪些品牌可以参考?")

11.3 多平台调用模块

platforms = [doubao, deepseek, qwen, kimi, wenxin, yuanbao]

每个平台独立采集,避免单模型偏差。

11.4 原始回答存储模块

CREATE TABLE ai_answers (
    id BIGINT PRIMARY KEY,
    platform VARCHAR(50),
    question_id BIGINT,
    question_text TEXT,
    raw_answer TEXT,
    is_valid BOOLEAN,
    created_at TIMESTAMP
);

11.5 品牌实体识别模块

CREATE TABLE brand_aliases (
    brand_id VARCHAR(100),
    canonical_name VARCHAR(100),
    alias VARCHAR(100)
);

11.6 推荐意图识别模块

抽取每个品牌在回答中的角色:

{
  "brand": "新百伦",
  "mentioned": true,
  "recommended": true,
  "sentiment": "positive",
  "reason": ["舒适", "百搭", "适合城市步行"]
}

11.7 指标计算模块

mention_rate = mention_count / valid_answer_count
recommend_rate = recommend_count / valid_answer_count

综合得分可以根据业务目标设定权重:

score = (
    0.35 * mention_rate
    + 0.45 * recommend_rate
    + 0.10 * platform_coverage
    + 0.10 * scenario_coverage
)

这里的公式只是示例,实际报告公式需以具体系统设定为准。

11.8 报告生成模块

输出:

  • 综合榜
  • 提及率榜
  • 推荐率榜
  • 平台差异
  • 场景差异
  • 品牌标签图谱
  • GEO优化建议

12. 技术难点总结

这类AI心智指数系统,真正难的不是调用大模型,而是以下几个问题:

12.1 问题集是否足够真实

如果问题集设计不贴近真实用户,结果就会偏离实际使用场景。

12.2 品牌实体归一是否准确

同一品牌不同写法必须合并,否则排名会被拆散。

12.3 推荐意图识别是否可靠

提到品牌不等于推荐品牌。推荐率识别决定了报告解释力。

12.4 多平台差异是否被正确处理

不同AI平台回答风格不同,不能简单混合而不做平台维度分析。

12.5 无效样本是否剔除

拒答、泛化回答、无品牌回答、重复回答都需要处理。

12.6 指标是否可解释

综合得分不能只是黑箱分数,需要能解释为什么品牌排名靠前。

12.7 报告表达是否避免误导

AI心智指数不是销量榜、质量榜、消费推荐榜,必须明确边界。

这些难点决定了这类系统不只是“爬一批AI回答然后数品牌名”,而是一个涉及数据工程、NLP、实体识别、意图识别、指标建模和报告生成的完整链路。


13. 对开发者和品牌方的启发

对开发者来说,这份报告提供了一个很好的AI应用方向:

不要只做内容生成工具,要做AI输出观测系统。

现在很多AI产品还停留在“帮用户生成内容”的阶段,但更有长期价值的方向,是观测AI生态本身:

  • AI如何回答行业问题?
  • AI如何推荐品牌?
  • AI如何理解产品?
  • AI如何呈现企业?
  • AI如何形成答案排序?
  • AI对不同平台、不同问题、不同品牌是否存在差异?

这类系统未来会成为GEO基础设施。

对品牌方来说,这份报告也说明一个现实:

品牌不能只做广告声量,也不能只做传统SEO。

未来要持续监测:

AI知道我吗?
AI会在什么问题里提到我?
AI会不会推荐我?
AI推荐我的理由是否准确?
AI有没有把我和错误场景绑定?
竞品在AI回答里为什么更靠前?

这类问题会成为品牌数字化运营的新模块。


14. 结语:AI品牌排名的本质,是对“答案位置”的量化

《2026毕业旅行运动鞋品牌AI心智指数报告》的表面结果是:

新百伦综合得分第一,耐克提及率最高,阿迪达斯位列第三,李宁、安踏进入前五,萨洛蒙、亚瑟士、Hoka One One、迈乐代表功能型品牌进入AI推荐视野。

但从技术角度看,它真正揭示的是:

生成式AI正在成为新的信息分发层。

用户不再只是搜索关键词,而是提出完整问题。

AI不再只是返回网页,而是直接生成答案。

品牌不再只是争夺搜索排名,而是争夺AI回答里的答案位置。

这就是AI心智指数的技术价值。

它把一个看似抽象的问题量化了:

当用户向AI提出真实问题时,谁更容易成为答案?

在搜索时代,品牌需要关注SEO。

在推荐时代,品牌需要关注内容分发。

在生成式AI时代,品牌还需要关注GEO和AI心智。

毕业旅行运动鞋只是一个具体切口。

未来,这种方法可以扩展到手机、电脑、汽车、旅游城市、咖啡、茶饮、护肤、教育服务、企业软件、云服务、开发工具等更多领域。

对技术人来说,这是一类值得关注的新型数据产品。

对品牌来说,这是一块正在形成的新战场。

对用户来说,这意味着未来我们看到的AI答案,也会成为影响认知和选择的重要入口。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐