这个问题我觉得有一个很有意思的地方:

大家未必认为 ChatGPT 比 Gemini 更容易“降智”,但一旦 ChatGPT 表现变差,用户的反应往往明显更大。

为什么?

我觉得最核心的原因不是模型跑分,而是:

大家对 ChatGPT 的期待太高了。

一个你本来觉得考60分的人,这次考55分,你可能没什么感觉。

但一个长期考95分的人,突然连续几次考75分,你第一反应一定是:

“你最近怎么了?”

ChatGPT现在面对的差不多就是这个问题。

ChatGPT最大的问题,是它曾经把用户胃口养得太高

很多人第一次真正被大模型震撼,就是ChatGPT。

2022年底刚出来的时候,那种感觉现在可能很难复现了。

以前搜索一个问题:

自己找网页。

自己看资料。

自己判断。

ChatGPT出来以后,你突然发现:

我可以直接和电脑讨论问题了。

后来模型越来越强,推理、图片、文件、搜索、Deep Research、Codex这些能力又不断往里面加。

于是用户对ChatGPT的定位慢慢变了。

以前是:

“AI能回答成这样已经很厉害了。”

现在变成:

“你可是ChatGPT,这都不会?”

这句话其实很能说明问题。

ChatGPT已经不是在和2022年的AI比较了。

它是在和**用户记忆里那个“状态最好时的ChatGPT”**比较。

这才是最麻烦的。

Gemini的历史包袱反而没那么重

Gemini其实也会答错,也会出现前后不一致,也有一些回答让人觉得莫名其妙。

但用户对它的心理预期不太一样。

尤其早期Bard时期,很多人本来就觉得:

“Google这个AI好像没有ChatGPT那么惊艳。”

后来Gemini一点点追上来,反而形成了另一种心理:

Gemini这次回答不错?

“可以啊,Google最近进步挺大。”

ChatGPT这次回答一般?

“OpenAI是不是又降智了?”

你会发现,同样一个80分的回答,放在两个产品身上,用户评价可能完全不一样。

因为一个是从70分走到80分。

另一个在人们印象里可能是从95分掉到了80分。

人的感受从来不是只看绝对值。

更看重变化。

还有一个原因:很多人是真的花钱订了ChatGPT

这个影响其实很大。

如果一个产品免费,你偶尔遇到一次回答不好,可能关掉就算了。

但ChatGPT有大量Plus、Pro用户。

尤其是Pro用户,每个月付的钱并不少。

一旦付费,心理就完全不同了。

比如昨天:

同一个Prompt回答特别好。

今天:

突然变得特别敷衍。

用户当然会想:

“我每个月付这么多钱,为什么体验还倒退了?”

这种愤怒并不完全来自“AI变笨”。

而是来自:

付费以后产生的稳定性预期。

你可以想象一下。

一家餐厅免费请你吃饭。

今天味道一般,你可能觉得算了。

但如果一家餐厅人均500块,第一次特别好吃,第二次明显变差,你大概率会吐槽。

不是第二顿真的难吃到不能吃。

而是:

我付的钱和我的期待不匹配了。

ChatGPT还有一个特别吃亏的地方:大家天天在测它

网上测试AI模型,有一个很有意思的现象。

一个新模型出来以后,很多人第一件事就是:

拿以前ChatGPT答过的问题再问一次。

然后开始比较:

“GPT-5.6这次怎么回答得还不如以前?”

“这个问题GPT-4当年都能答。”

“是不是偷偷换模型了?”

ChatGPT已经变成了某种意义上的“基准”。

大家拿Claude和它比。

拿Gemini和它比。

拿DeepSeek和它比。

甚至ChatGPT的新版本还要和ChatGPT自己的老版本比。

所以它特别容易产生“降智”的讨论。

Gemini很多时候面对的是:

“这次有没有超过ChatGPT?”

ChatGPT面对的是:

“你为什么没有超过你自己?”

后一个要求其实难得多。

而且“降智”这件事,本来就特别难证明

我觉得网上关于AI降智的讨论,有一部分确实存在体验依据,但也有很多属于主观感受。

因为大模型不是计算器。

同一个问题,你问两次,本来就可能得到不同答案。

另外还会受到很多东西影响:

模型路由。

推理强度。

上下文。

系统指令。

是否联网。

工具调用。

对话长度。

产品策略。

甚至你Prompt里面一个词的变化。

所以你昨天问一道题答得很好,今天答差了,并不能直接证明:

“OpenAI把模型智商砍了20%。”

但用户不关心这些。

用户看到的就是:

昨天能做,今天做不好。

那最直观的解释当然就是:

“降智了。”

还有一个经常被忽略的问题:ChatGPT已经不只是一个模型了

现在很多人嘴里的“ChatGPT”,其实混合了很多东西。

模型是一层。

推理等级是一层。

搜索是一层。

工具是一层。

Codex又是一层。

系统还可能根据任务选择不同的处理方式。

所以有时候用户觉得:

“ChatGPT怎么突然变笨了?”

未必真的是底层模型能力下降。

也可能是这一次没有投入同样的推理资源,或者任务被用不同方式处理了。

这也是为什么我现在越来越不建议:

拿一个Prompt测试一次,就宣布某个模型降智。

至少同一个问题测试几次,再换几个不同类型的问题,结论才稍微有参考价值。

Gemini为什么相对少挨这种骂?

还有一个很现实的原因:

很多人的主力工具本来就不是Gemini。

这点非常重要。

假设你每天使用ChatGPT三个小时。

写文章用它。

写代码用Codex。

查资料用它。

分析PDF也用它。

突然有一天,它某个能力发生变化。

你马上就能感觉出来。

但如果Gemini你一周才打开两次。

它今天比昨天差5%,你根本察觉不到。

这和手机一样。

你每天用的主力手机掉10%续航,你会特别敏感。

备用机掉20%,可能半年以后你才发现。

所以一个产品被骂“降智”多,有时候反而说明:

它已经进入了大量用户真正的工作流。

我甚至觉得,“降智骂得凶”某种程度上是ChatGPT成功的副作用

这可能听起来有点奇怪。

但你仔细想。

如果明天一个没人用的AI模型能力下降20%,网上会有人骂吗?

不会。

因为根本没人发现。

只有当一个工具变成:

程序员每天写代码要用。

学生每天学习要用。

自媒体每天写东西要用。

公司每天处理资料要用。

它的一点变化才会被迅速放大。

这和Windows更新一样。

Windows每次更新出点问题,网上一片骂声。

不是因为全世界只有Windows有Bug。

而是因为太多人每天依赖它。

当然,这不代表所有“ChatGPT降智”都是用户错觉

我也不赞成另外一种极端说法:

“模型跑分提高了,所以你觉得变笨一定是你的问题。”

这也不合理。

跑分提升和真实使用体验,本来就不是完全一回事。

一个模型可以在数学、代码、科学测试上越来越强,同时因为回答风格、路由策略、推理资源或者产品调整,让某些用户觉得日常任务反而没有以前顺手。

能力更强,不等于每一种任务的体验都更好。

这点其实很重要。

用户最终使用的是产品,不是Benchmark表格。

你告诉我新模型跑分高了15%,但我每天做的那件事情反而更难用了,那对于我来说,这就是体验下降。

所以为什么大家更厌恶ChatGPT“降智”?

我觉得说到底就是四个字:

期待太高。

ChatGPT是很多人的第一款AI。

也是很多人的主力AI。

还有大量用户每个月真金白银给它付费。

大家已经习惯了它不断变强。

于是它一旦表现得没有以前好,哪怕只是某些场景下的波动,用户都会非常敏感。

Gemini则有点相反。

它早期没有把用户期待拉到那么夸张的高度,后来能力一路往上走,用户更容易产生“它越来越好了”的感觉。

所以同样一次回答失误:

Gemini:

“这次没答好。”

ChatGPT:

“是不是又降智了?”

我觉得这可能才是两者最大的区别。

用户真正厌恶的从来不是一个AI“不够聪明”。

而是:

一个你已经习惯它很聪明、甚至开始依赖它的AI,突然没有昨天那么聪明了。

从这个角度看,大家天天骂ChatGPT降智,某种程度上反而说明了一件事:

很多人已经不是在“体验ChatGPT”了,而是真的在依赖ChatGPT。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐