为什么大家都更厌恶ChatGPT降智而不是Gemini?
这个问题我觉得有一个很有意思的地方:
大家未必认为 ChatGPT 比 Gemini 更容易“降智”,但一旦 ChatGPT 表现变差,用户的反应往往明显更大。
为什么?
我觉得最核心的原因不是模型跑分,而是:
大家对 ChatGPT 的期待太高了。
一个你本来觉得考60分的人,这次考55分,你可能没什么感觉。
但一个长期考95分的人,突然连续几次考75分,你第一反应一定是:
“你最近怎么了?”
ChatGPT现在面对的差不多就是这个问题。
ChatGPT最大的问题,是它曾经把用户胃口养得太高
很多人第一次真正被大模型震撼,就是ChatGPT。
2022年底刚出来的时候,那种感觉现在可能很难复现了。
以前搜索一个问题:
自己找网页。
自己看资料。
自己判断。
ChatGPT出来以后,你突然发现:
我可以直接和电脑讨论问题了。
后来模型越来越强,推理、图片、文件、搜索、Deep Research、Codex这些能力又不断往里面加。
于是用户对ChatGPT的定位慢慢变了。
以前是:
“AI能回答成这样已经很厉害了。”
现在变成:
“你可是ChatGPT,这都不会?”
这句话其实很能说明问题。
ChatGPT已经不是在和2022年的AI比较了。
它是在和**用户记忆里那个“状态最好时的ChatGPT”**比较。
这才是最麻烦的。
Gemini的历史包袱反而没那么重
Gemini其实也会答错,也会出现前后不一致,也有一些回答让人觉得莫名其妙。
但用户对它的心理预期不太一样。
尤其早期Bard时期,很多人本来就觉得:
“Google这个AI好像没有ChatGPT那么惊艳。”
后来Gemini一点点追上来,反而形成了另一种心理:
Gemini这次回答不错?
“可以啊,Google最近进步挺大。”
ChatGPT这次回答一般?
“OpenAI是不是又降智了?”
你会发现,同样一个80分的回答,放在两个产品身上,用户评价可能完全不一样。
因为一个是从70分走到80分。
另一个在人们印象里可能是从95分掉到了80分。
人的感受从来不是只看绝对值。
更看重变化。
还有一个原因:很多人是真的花钱订了ChatGPT
这个影响其实很大。
如果一个产品免费,你偶尔遇到一次回答不好,可能关掉就算了。
但ChatGPT有大量Plus、Pro用户。
尤其是Pro用户,每个月付的钱并不少。
一旦付费,心理就完全不同了。
比如昨天:
同一个Prompt回答特别好。
今天:
突然变得特别敷衍。
用户当然会想:
“我每个月付这么多钱,为什么体验还倒退了?”
这种愤怒并不完全来自“AI变笨”。
而是来自:
付费以后产生的稳定性预期。
你可以想象一下。
一家餐厅免费请你吃饭。
今天味道一般,你可能觉得算了。
但如果一家餐厅人均500块,第一次特别好吃,第二次明显变差,你大概率会吐槽。
不是第二顿真的难吃到不能吃。
而是:
我付的钱和我的期待不匹配了。
ChatGPT还有一个特别吃亏的地方:大家天天在测它
网上测试AI模型,有一个很有意思的现象。
一个新模型出来以后,很多人第一件事就是:
拿以前ChatGPT答过的问题再问一次。
然后开始比较:
“GPT-5.6这次怎么回答得还不如以前?”
“这个问题GPT-4当年都能答。”
“是不是偷偷换模型了?”
ChatGPT已经变成了某种意义上的“基准”。
大家拿Claude和它比。
拿Gemini和它比。
拿DeepSeek和它比。
甚至ChatGPT的新版本还要和ChatGPT自己的老版本比。
所以它特别容易产生“降智”的讨论。
Gemini很多时候面对的是:
“这次有没有超过ChatGPT?”
ChatGPT面对的是:
“你为什么没有超过你自己?”
后一个要求其实难得多。
而且“降智”这件事,本来就特别难证明
我觉得网上关于AI降智的讨论,有一部分确实存在体验依据,但也有很多属于主观感受。
因为大模型不是计算器。
同一个问题,你问两次,本来就可能得到不同答案。
另外还会受到很多东西影响:
模型路由。
推理强度。
上下文。
系统指令。
是否联网。
工具调用。
对话长度。
产品策略。
甚至你Prompt里面一个词的变化。
所以你昨天问一道题答得很好,今天答差了,并不能直接证明:
“OpenAI把模型智商砍了20%。”
但用户不关心这些。
用户看到的就是:
昨天能做,今天做不好。
那最直观的解释当然就是:
“降智了。”
还有一个经常被忽略的问题:ChatGPT已经不只是一个模型了
现在很多人嘴里的“ChatGPT”,其实混合了很多东西。
模型是一层。
推理等级是一层。
搜索是一层。
工具是一层。
Codex又是一层。
系统还可能根据任务选择不同的处理方式。
所以有时候用户觉得:
“ChatGPT怎么突然变笨了?”
未必真的是底层模型能力下降。
也可能是这一次没有投入同样的推理资源,或者任务被用不同方式处理了。
这也是为什么我现在越来越不建议:
拿一个Prompt测试一次,就宣布某个模型降智。
至少同一个问题测试几次,再换几个不同类型的问题,结论才稍微有参考价值。
Gemini为什么相对少挨这种骂?
还有一个很现实的原因:
很多人的主力工具本来就不是Gemini。
这点非常重要。
假设你每天使用ChatGPT三个小时。
写文章用它。
写代码用Codex。
查资料用它。
分析PDF也用它。
突然有一天,它某个能力发生变化。
你马上就能感觉出来。
但如果Gemini你一周才打开两次。
它今天比昨天差5%,你根本察觉不到。
这和手机一样。
你每天用的主力手机掉10%续航,你会特别敏感。
备用机掉20%,可能半年以后你才发现。
所以一个产品被骂“降智”多,有时候反而说明:
它已经进入了大量用户真正的工作流。
我甚至觉得,“降智骂得凶”某种程度上是ChatGPT成功的副作用
这可能听起来有点奇怪。
但你仔细想。
如果明天一个没人用的AI模型能力下降20%,网上会有人骂吗?
不会。
因为根本没人发现。
只有当一个工具变成:
程序员每天写代码要用。
学生每天学习要用。
自媒体每天写东西要用。
公司每天处理资料要用。
它的一点变化才会被迅速放大。
这和Windows更新一样。
Windows每次更新出点问题,网上一片骂声。
不是因为全世界只有Windows有Bug。
而是因为太多人每天依赖它。
当然,这不代表所有“ChatGPT降智”都是用户错觉
我也不赞成另外一种极端说法:
“模型跑分提高了,所以你觉得变笨一定是你的问题。”
这也不合理。
跑分提升和真实使用体验,本来就不是完全一回事。
一个模型可以在数学、代码、科学测试上越来越强,同时因为回答风格、路由策略、推理资源或者产品调整,让某些用户觉得日常任务反而没有以前顺手。
能力更强,不等于每一种任务的体验都更好。
这点其实很重要。
用户最终使用的是产品,不是Benchmark表格。
你告诉我新模型跑分高了15%,但我每天做的那件事情反而更难用了,那对于我来说,这就是体验下降。
所以为什么大家更厌恶ChatGPT“降智”?
我觉得说到底就是四个字:
期待太高。
ChatGPT是很多人的第一款AI。
也是很多人的主力AI。
还有大量用户每个月真金白银给它付费。
大家已经习惯了它不断变强。
于是它一旦表现得没有以前好,哪怕只是某些场景下的波动,用户都会非常敏感。
Gemini则有点相反。
它早期没有把用户期待拉到那么夸张的高度,后来能力一路往上走,用户更容易产生“它越来越好了”的感觉。
所以同样一次回答失误:
Gemini:
“这次没答好。”
ChatGPT:
“是不是又降智了?”
我觉得这可能才是两者最大的区别。
用户真正厌恶的从来不是一个AI“不够聪明”。
而是:
一个你已经习惯它很聪明、甚至开始依赖它的AI,突然没有昨天那么聪明了。
从这个角度看,大家天天骂ChatGPT降智,某种程度上反而说明了一件事:
很多人已经不是在“体验ChatGPT”了,而是真的在依赖ChatGPT。
更多推荐



所有评论(0)