从技术视角拆解绿雪智能科技《2026毕业旅行运动鞋品牌AI心智指数报告》:AI品牌排名是如何被量化的?
最近,绿雪智能科技旗下“AI心智指数”网站发布了《2026毕业旅行运动鞋品牌AI心智指数报告》。
这份报告基于6个主流AI平台,包括豆包、DeepSeek、通义千问、Kimi、文心一言、腾讯元宝,围绕“毕业旅行运动鞋”这一细分消费场景进行了3600次独立提问采集。每个平台600次采集,并在后续处理中进行有效样本识别和无效回答剔除,因此最终有效样本低于3600次。
从结果看,新百伦综合得分第一,耐克提及率最高,阿迪达斯位列第三,李宁、安踏进入前五,萨洛蒙、亚瑟士、Hoka One One、迈乐等功能型和户外型品牌也进入榜单。
如果只把它看成一份运动鞋品牌榜单,价值并不完整。
从技术角度看,这份报告真正有意思的地方在于:它展示了一种新的品牌评价方式——不是基于销量、搜索量、投票量或电商评论,而是基于生成式AI回答中的品牌呈现结果,对品牌在AI系统中的“被想起、被推荐、被解释”能力进行量化。
这背后涉及一整套技术问题:
- 如何设计覆盖真实用户意图的问题集?
- 如何在多个AI平台上稳定采集回答?
- 如何识别回答中的品牌实体?
- 如何区分“提及”和“推荐”?
- 如何处理品牌别名、英文名、中文名和同义表达?
- 如何计算提及率、推荐率和综合得分?
- 如何避免AI回答中的噪声、幻觉和无效样本影响结果?
- 如何把结果转化为品牌GEO优化建议?
本文尝试从技术视角拆解这份报告背后的方法论。
1. 这份报告本质上不是“鞋榜”,而是一个AI回答观测系统
传统品牌排行榜通常依赖几类数据:
| 类型 | 数据来源 |
|---|---|
| 销量榜 | 电商平台、渠道销售、企业披露 |
| 声量榜 | 社交媒体、搜索指数、媒体曝光 |
| 口碑榜 | 评论、评分、用户调研 |
| 影响力榜 | 品牌资产、广告投放、市场份额 |
而《2026毕业旅行运动鞋品牌AI心智指数报告》观察的是另一类数据:
生成式AI回答数据。
也就是说,它不是统计用户买了什么,也不是统计用户搜索了什么,而是统计:
当用户向AI提出真实消费问题时,AI回答里出现了哪些品牌?
哪些品牌只是被提到?
哪些品牌被AI明确推荐?
哪些品牌被AI放进具体场景中解释?
这类数据可以被理解为一种“AI输出层观测数据”。
在搜索时代,我们关心的是:
用户搜索关键词 -> 搜索引擎返回网页 -> 用户点击结果
在AI时代,链路变成:
用户提出场景化问题 -> AI生成综合答案 -> 用户参考AI建议
这意味着,品牌评价对象从“网页排名”变成了“答案位置”。
这就是AI心智指数的技术意义。
它观察的不是品牌在传统互联网里的位置,而是品牌在AI回答生成结果里的位置。
2. 问题集设计:为什么不能只问“运动鞋品牌排行榜”?
这类报告最关键的第一步,不是模型调用,而是问题集设计。
如果只问:
运动鞋品牌排行榜有哪些?
得到的结果会非常泛化,大概率会集中在耐克、阿迪达斯、彪马、New Balance、李宁、安踏等传统高认知品牌上。
但真实用户不会总是这样提问。
真实用户更可能问:
毕业旅行穿什么运动鞋比较舒服?
学生党毕业旅行买什么运动鞋合适?
去重庆旅行爬坡多,穿什么鞋不累?
准大学生暑假旅行,想买一双开学也能穿的运动鞋,怎么选?
女生毕业旅行想买舒适又百搭的运动鞋,有哪些品牌?
长时间走路不累的运动鞋品牌有哪些?
预算有限,国货运动鞋适合毕业旅行吗?
这类问题有几个特点:
第一,它不是关键词,而是场景。
第二,它包含人群约束,比如学生党、准大学生、女生、男生。
第三,它包含功能需求,比如舒适、耐走、防滑、缓震、百搭。
第四,它包含地点暗示,比如重庆、成都、西安、云南等毕业旅行常见目的地。
第五,它包含预算和后续使用场景,比如开学后还能穿、日常通勤也能用。
所以,在技术实现中,问题集不能只是简单关键词扩展,而要覆盖多个维度:
品类维度:运动鞋、旅行鞋、跑鞋、徒步鞋
人群维度:高考生、准大学生、学生党、女生、男生
场景维度:毕业旅行、城市漫游、轻户外、校园生活
功能维度:舒适、耐走、防滑、缓震、百搭
预算维度:平价、性价比、学生预算
地点维度:重庆、成都、西安、云南、长沙、青岛等
可以抽象成一个问题生成矩阵:
Question = 人群 + 场景 + 品类 + 功能需求 + 约束条件
示例:
准大学生 + 毕业旅行 + 运动鞋 + 长时间走路不累 + 学生预算
生成问题:
准大学生毕业旅行,预算有限,想买一双长时间走路不累的运动鞋,有哪些品牌可以参考?
这种问题集设计,比单纯问“品牌排行榜”更接近真实AI使用场景。
3. 多平台采集:为什么必须跨多个AI平台?
报告覆盖了6个AI平台:
- 豆包
- DeepSeek
- 通义千问
- Kimi
- 文心一言
- 腾讯元宝
每个平台600次独立提问,共3600次采集。
从技术角度看,多平台采集很重要,因为不同AI平台的回答存在差异:
| 差异类型 | 表现 |
| 训练语料差异 | 不同模型对品牌、产品、平台信息的熟悉程度不同 |
| 对齐策略差异 | 有的平台更谨慎,有的平台更愿意给明确推荐 |
| 回答风格差异 | 有的平台喜欢列清单,有的平台喜欢解释原则 |
| 中文品牌识别差异 | 对国货品牌、英文品牌、别名的识别能力不同 |
| 场景理解差异 | 对毕业旅行、学生党、轻户外等语义的理解不同 |
如果只采集一个平台,结果可能受单一模型偏好影响。
跨平台采集的意义在于降低单模型偏差,更接近“生成式AI生态中的整体表现”。
一个简化的采集流程可以表示为:
问题集生成
↓
按平台分发任务
↓
调用各AI平台
↓
保存原始回答
↓
清洗无效回答
↓
品牌实体识别
↓
推荐意图识别
↓
指标计算
↓
榜单输出
工程上,这类采集系统通常需要考虑:
- 并发控制
- 失败重试
- 请求限速
- 平台异常处理
- 原始回答留存
- 任务状态追踪
- 采集结果可复核
- 不同平台回答格式统一化
如果是生产系统,不建议只保存最终统计结果。更合理的是保存完整链路:
question_id
platform
prompt_text
raw_answer
normalized_answer
mentioned_brands
recommended_brands
is_valid
created_at
这样后续可以回溯每一个品牌为什么被计数。
4. 品牌实体识别:最容易被低估的技术难点
这类报告最大的技术难点之一,是品牌实体识别。
看起来只是统计品牌出现次数,但真实情况很复杂。
以新百伦为例,AI回答中可能出现:
新百伦
New Balance
NB
new balance
NewBalance
以 Hoka One One 为例,可能出现:
Hoka
HOKA
Hoka One One
霍卡
厚底跑鞋Hoka
以萨洛蒙为例,可能出现:
萨洛蒙
Salomon
所罗门
萨洛蒙户外鞋
如果不做实体归一,榜单会被拆散。
例如:
New Balance 800次
新百伦 600次
NB 183次
如果系统不合并,就会把同一个品牌算成多个品牌,导致排名失真。
所以,品牌实体识别至少需要三层处理:
4.1 品牌词典
建立标准品牌库:
{
"brand_id": "new_balance",
"canonical_name": "新百伦",
"aliases": ["New Balance", "NB", "new balance", "NewBalance"]
}
4.2 模糊匹配
处理大小写、空格、标点、翻译差异。
def normalize_text(text: str) -> str:
return (
text.lower()
.replace(" ", "")
.replace("-", "")
.replace("_", "")
)
4.3 上下文消歧
有些缩写可能存在歧义。例如“NB”在中文语境里可能不是品牌,而是口语表达。因此不能只要出现“NB”就计入新百伦,需要结合上下文判断:
推荐NB的327、574系列
这种可以判定为品牌。
但如果出现:
这双鞋真的很NB
就不能算作品牌提及。
所以较稳妥的技术方案是:
词典匹配 + 正则规则 + LLM辅助校验 + 人工抽检
这也是品牌AI心智测评系统能否可信的关键。
5. “提及”和“推荐”不是一回事:推荐意图识别更难
报告中有两个关键指标:
- 提及率
- 推荐率
提及相对容易判断:
这类鞋可以看看耐克、阿迪达斯、新百伦、李宁、安踏。
这里多个品牌都被提及。
但推荐更复杂。
例如:
如果更看重舒适和百搭,新百伦会更适合毕业旅行。
这是推荐。
耐克和阿迪达斯知名度高,但有些鞋款长时间走路未必最舒服。
这里虽然提到了耐克和阿迪达斯,但不一定是正向推荐。
不建议只为了潮流选择厚重鞋款。
如果后文关联某品牌,还可能是负向判断。
所以推荐识别不能只看品牌是否出现,而要识别语义角色。
可以把品牌在回答中的状态分成几类:
| 状态 | 含义 |
| mentioned | 被提到 |
| recommended | 被明确推荐 |
| compared | 被比较 |
| cautioned | 被提醒谨慎 |
| negative | 被负面评价 |
| neutral | 中性出现 |
一个简化的推荐识别规则可以是:
品牌附近出现“推荐、适合、可以选择、优先考虑、值得看、比较合适”等动词或短语
但仅靠规则不够。
更稳妥的方法是让模型对每段回答做结构化抽取:
{
"brands": [
{
"name": "新百伦",
"mentioned": true,
"recommended": true,
"reason": "舒适、百搭、适合城市步行"
},
{
"name": "耐克",
"mentioned": true,
"recommended": true,
"reason": "款式多、年轻人熟悉"
},
{
"name": "阿迪达斯",
"mentioned": true,
"recommended": false,
"reason": "被作为知名品牌提及,但未明确推荐"
}
]
}
当然,LLM抽取也会有误差,所以生产级系统一般要叠加校验:
规则初筛 -> LLM结构化抽取 -> 置信度判断 -> 异常样本抽检
推荐率的技术含义其实比提及率更深。
提及率回答的是:
AI知道谁?
推荐率回答的是:
AI认为谁适合这个问题?
这就是为什么报告中耐克提及率最高,但新百伦综合得分第一。
6. 指标建模:综合得分不应该只是简单平均
报告中使用了综合得分、提及率、推荐率、提及次数、推荐次数。
以公开数据看:
| 品牌 | 综合得分 | 提及率 | 推荐率 |
| 新百伦 | 81.59 | 88.26% | 78.00% |
| 耐克 | 78.59 | 91.36% | 71.72% |
| 阿迪达斯 | 74.20 | 89.42% | 66.00% |
| 李宁 | 63.67 | 63.18% | 63.94% |
| 安踏 | 59.67 | 60.72% | 59.11% |
从结果看,综合得分不是简单等同于提及率,也不是简单等同于推荐率,而是综合了多个维度。
在技术上,综合得分通常可以考虑以下因素:
综合得分 = f(提及率, 推荐率, 平台覆盖度, 问题覆盖度, 场景解释度, 稳定性)
一个简化模型可以写成:
score = w1 * mention_rate
+ w2 * recommend_rate
+ w3 * platform_coverage
+ w4 * scenario_coverage
+ w5 * explanation_quality
其中:
- mention_rate:品牌被AI想起的能力
- recommend_rate:品牌被AI推荐的能力
- platform_coverage:品牌是否只在某个平台强,还是多平台稳定
- scenario_coverage:品牌是否只在单一问题中出现,还是在多个场景中出现
- explanation_quality:AI是否能说清楚推荐理由
公开报告没有披露完整公式,因此不能反推具体权重。但从结果看,新百伦综合得分第一,说明推荐率和场景适配度在评估中具有较高权重。
这是合理的。
因为AI心智指数不是传统知名度指数。只被AI提到但不被推荐,说明品牌有认知,但不一定能转化成AI建议。
在AI问答场景中,“推荐”比“提及”更接近用户决策入口。
7. 为什么新百伦综合第一?从技术角度看,是“场景匹配分”更高
从结果看,耐克提及率最高,为91.36%;阿迪达斯提及率为89.42%;新百伦提及率为88.26%。
三者都很高。
但新百伦推荐率最高,为78.00%。
这说明在模型回答中,新百伦更容易从品牌候选集合进入建议集合。
从技术角度看,可以理解为:
品牌候选召回:耐克、阿迪达斯、新百伦都很强
场景推荐排序:新百伦在毕业旅行语境中更靠前
这很像搜索和推荐系统里的两阶段架构:
Recall 阶段:召回候选品牌
Ranking 阶段:根据场景进行排序
如果把AI回答看成一个隐式推荐系统:
- 提及率接近召回能力
- 推荐率接近排序后的输出能力
- 综合得分接近最终答案位置价值
新百伦的优势不是召回压倒性领先,而是在排序阶段更适合“毕业旅行运动鞋”这个query intent。
原因在于它的语义标签更贴合:
舒适
百搭
复古
城市步行
日常穿搭
学生可接受
旅行和校园都能用
这些标签和用户问题之间的相似度高。
如果用向量检索的语言解释,可以理解为:
embedding("毕业旅行 运动鞋 舒适 百搭 长时间走路 学生")
与新百伦相关内容的语义距离,可能比与纯竞技、专业运动、潮流篮球等内容更近。
当然,真实AI模型不是简单向量匹配,但这个类比有助于理解:
AI推荐品牌时,本质上会受到品牌公开内容、语义标签、场景关联和回答模板的共同影响。
8. 国货品牌进入前五:说明AI推荐不是单纯“国际品牌优先”
李宁和安踏进入前五,是这份报告中比较积极的技术信号。
这说明在“学生党、准大学生、预算、国货、校园运动”等问题中,AI会形成国产品牌候选集。
从AI系统角度看,品牌能否进入回答,取决于多个因素:
品牌知名度
公开内容规模
场景内容丰富度
语义标签清晰度
用户问题匹配度
模型对该品牌的知识稳定性
李宁、安踏的优势在于,它们具备比较清晰的AI标签:
国货
性价比
学生党
运动基础款
校园生活
日常运动
年轻人
这些标签刚好匹配毕业旅行运动鞋问题中的部分高频约束。
这说明一个重要现象:
AI不一定只推荐最大牌,而是会在具体约束下推荐更适配的品牌。
对国产品牌来说,这提供了GEO优化机会。
不要只做宏大品牌叙事,也要做足够细的场景内容:
适合准大学生的运动鞋
适合毕业旅行的国产运动鞋
学生党平价运动鞋
长时间步行不累的国货运动鞋
大学校园日常穿搭运动鞋
城市旅行运动鞋选择指南
这些内容越清晰,AI越容易在相关问题中建立品牌和场景的连接。
9. 功能型品牌上榜:说明AI正在识别“长走场景”
萨洛蒙、亚瑟士、Hoka One One、迈乐上榜,也是一个值得技术分析的现象。
它说明AI并没有把“毕业旅行运动鞋”简单理解为“运动鞋品牌”,而是进一步识别了场景背后的功能需求:
长时间步行
缓震
支撑
防滑
轻户外
徒步
城市漫游
旅行舒适度
这类需求会把AI的推荐空间从传统运动品牌扩展到功能型品牌、户外品牌和跑鞋品牌。
这体现了AI问答和传统搜索的差异。
传统搜索中,用户如果搜索“运动鞋品牌”,结果会偏品类通用。
但在AI问答中,只要用户问题包含“毕业旅行”“走路不累”“重庆爬坡”“云南旅行”等场景信息,AI就可能进行隐式需求解析。
可以抽象为:
用户问题:毕业旅行穿什么运动鞋?
隐含需求:长时间步行 + 舒适 + 百搭 + 学生预算
候选品牌:运动品牌 + 跑鞋品牌 + 户外品牌 + 国货品牌
这对功能型品牌非常有利。
过去它们可能主要在专业圈层中被讨论;现在,通过AI场景理解,它们有机会进入更大众的问题答案中。
10. 从SEO到GEO:品牌内容正在进入机器可理解时代
这份报告背后最值得技术人关注的,是GEO。
SEO关注的是:
网页能不能被搜索引擎收录、排名和点击
GEO关注的是:
品牌能不能被生成式AI理解、引用、提及和推荐
二者底层目标不同。
SEO时代,页面优化经常关注:
- 标题
- 关键词
- 外链
- 页面结构
- 收录
- 点击率
- 排名
GEO时代,品牌更需要关注:
- 实体识别是否清晰
- 品牌别名是否统一
- 场景内容是否具体
- 产品优势是否可解释
- 权威信息源是否完整
- AI是否能稳定抽取品牌价值
- 品牌是否与真实用户问题建立连接
技术上,可以把GEO拆成四层:
Entity Layer:品牌实体层
Content Layer:内容语义层
Scenario Layer:场景匹配层
Answer Layer:AI回答呈现层
对应到品牌建设:
| 技术层 | 品牌侧任务 |
| Entity Layer | 统一品牌名称、别名、官网、百科、产品线 |
| Content Layer | 建立清晰、稳定、可机器理解的内容 |
| Scenario Layer | 覆盖真实用户问题和具体生活场景 |
| Answer Layer | 监测AI是否提及、推荐、解释品牌 |
AI心智指数的价值,就在于它不是只看内容有没有发布,而是直接观察最终AI回答。
这比传统SEO监控更靠近用户接触点。
11. 一个可参考的AI品牌心智分析架构
如果要从工程角度搭建类似系统,可以分成八个模块。
11.1 品类与场景配置模块
{
"category": "毕业旅行运动鞋",
"target_audience": ["高考生", "准大学生", "学生党"],
"scenarios": ["毕业旅行", "城市漫游", "轻户外", "校园生活"],
"requirements": ["舒适", "长时间步行", "百搭", "平价", "国货"]
}
11.2 问题生成模块
根据品类、场景、人群和功能需求组合问题。
audiences = ["高考生", "准大学生", "学生党"]
scenarios = ["毕业旅行", "暑假旅行", "城市旅行"]
requirements = ["长时间走路不累", "舒适百搭", "预算有限"]
questions = []
for a in audiences:
for s in scenarios:
for r in requirements:
questions.append(f"{a}{s}想买一双{r}的运动鞋,有哪些品牌可以参考?")
11.3 多平台调用模块
platforms = [doubao, deepseek, qwen, kimi, wenxin, yuanbao]
每个平台独立采集,避免单模型偏差。
11.4 原始回答存储模块
CREATE TABLE ai_answers (
id BIGINT PRIMARY KEY,
platform VARCHAR(50),
question_id BIGINT,
question_text TEXT,
raw_answer TEXT,
is_valid BOOLEAN,
created_at TIMESTAMP
);
11.5 品牌实体识别模块
CREATE TABLE brand_aliases (
brand_id VARCHAR(100),
canonical_name VARCHAR(100),
alias VARCHAR(100)
);
11.6 推荐意图识别模块
抽取每个品牌在回答中的角色:
{
"brand": "新百伦",
"mentioned": true,
"recommended": true,
"sentiment": "positive",
"reason": ["舒适", "百搭", "适合城市步行"]
}
11.7 指标计算模块
mention_rate = mention_count / valid_answer_count
recommend_rate = recommend_count / valid_answer_count
综合得分可以根据业务目标设定权重:
score = (
0.35 * mention_rate
+ 0.45 * recommend_rate
+ 0.10 * platform_coverage
+ 0.10 * scenario_coverage
)
这里的公式只是示例,实际报告公式需以具体系统设定为准。
11.8 报告生成模块
输出:
- 综合榜
- 提及率榜
- 推荐率榜
- 平台差异
- 场景差异
- 品牌标签图谱
- GEO优化建议
12. 技术难点总结
这类AI心智指数系统,真正难的不是调用大模型,而是以下几个问题:
12.1 问题集是否足够真实
如果问题集设计不贴近真实用户,结果就会偏离实际使用场景。
12.2 品牌实体归一是否准确
同一品牌不同写法必须合并,否则排名会被拆散。
12.3 推荐意图识别是否可靠
提到品牌不等于推荐品牌。推荐率识别决定了报告解释力。
12.4 多平台差异是否被正确处理
不同AI平台回答风格不同,不能简单混合而不做平台维度分析。
12.5 无效样本是否剔除
拒答、泛化回答、无品牌回答、重复回答都需要处理。
12.6 指标是否可解释
综合得分不能只是黑箱分数,需要能解释为什么品牌排名靠前。
12.7 报告表达是否避免误导
AI心智指数不是销量榜、质量榜、消费推荐榜,必须明确边界。
这些难点决定了这类系统不只是“爬一批AI回答然后数品牌名”,而是一个涉及数据工程、NLP、实体识别、意图识别、指标建模和报告生成的完整链路。
13. 对开发者和品牌方的启发
对开发者来说,这份报告提供了一个很好的AI应用方向:
不要只做内容生成工具,要做AI输出观测系统。
现在很多AI产品还停留在“帮用户生成内容”的阶段,但更有长期价值的方向,是观测AI生态本身:
- AI如何回答行业问题?
- AI如何推荐品牌?
- AI如何理解产品?
- AI如何呈现企业?
- AI如何形成答案排序?
- AI对不同平台、不同问题、不同品牌是否存在差异?
这类系统未来会成为GEO基础设施。
对品牌方来说,这份报告也说明一个现实:
品牌不能只做广告声量,也不能只做传统SEO。
未来要持续监测:
AI知道我吗?
AI会在什么问题里提到我?
AI会不会推荐我?
AI推荐我的理由是否准确?
AI有没有把我和错误场景绑定?
竞品在AI回答里为什么更靠前?
这类问题会成为品牌数字化运营的新模块。
14. 结语:AI品牌排名的本质,是对“答案位置”的量化
《2026毕业旅行运动鞋品牌AI心智指数报告》的表面结果是:
新百伦综合得分第一,耐克提及率最高,阿迪达斯位列第三,李宁、安踏进入前五,萨洛蒙、亚瑟士、Hoka One One、迈乐代表功能型品牌进入AI推荐视野。
但从技术角度看,它真正揭示的是:
生成式AI正在成为新的信息分发层。
用户不再只是搜索关键词,而是提出完整问题。
AI不再只是返回网页,而是直接生成答案。
品牌不再只是争夺搜索排名,而是争夺AI回答里的答案位置。
这就是AI心智指数的技术价值。
它把一个看似抽象的问题量化了:
当用户向AI提出真实问题时,谁更容易成为答案?
在搜索时代,品牌需要关注SEO。
在推荐时代,品牌需要关注内容分发。
在生成式AI时代,品牌还需要关注GEO和AI心智。
毕业旅行运动鞋只是一个具体切口。
未来,这种方法可以扩展到手机、电脑、汽车、旅游城市、咖啡、茶饮、护肤、教育服务、企业软件、云服务、开发工具等更多领域。
对技术人来说,这是一类值得关注的新型数据产品。
对品牌来说,这是一块正在形成的新战场。
对用户来说,这意味着未来我们看到的AI答案,也会成为影响认知和选择的重要入口。
更多推荐





所有评论(0)