期望越高,失望越大:ChatGPT 为何总被骂“降智”

如果你混迹于 AI 社区,一定见过这样的场景:ChatGPT 偶尔回答得不够完美,评论区立刻炸锅,满屏都是"OpenAI 又降智了”、“模型被偷偷替换了”的指责。然而,当隔壁的 Gemini 犯下同样的逻辑错误,或者给出一个平庸的回答时,舆论却往往温和得多,甚至有人会觉得“谷歌这次表现还行”。

这真的只是因为 ChatGPT 的技术实力下滑得比对手快吗?未必。很多时候,这种强烈的反差并非源于模型能力的绝对值变化,而是用户心理预期产品定位错位的结果。当我们剥离掉技术术语,从用户体验和心理学的角度去审视,会发现 ChatGPT 其实是被自己曾经的辉煌“坑”了。

被“神化”的历史包袱:95 分掉到 80 分的落差感

人对事物的评价,从来不是基于绝对的分数,而是基于变化的幅度

回想 2022 年底,ChatGPT 横空出世时,它给整个世界带来的震撼是前所未有的。那是很多人第一次意识到,原来机器真的可以像人一样对话、写代码、做分析。在那个阶段,用户对它的容忍度极高,只要它能跑通一段代码或写出一篇通顺的文章,大家就会惊呼"AI 太神奇了”。

正是这种早期的惊艳表现,将用户的心理阈值拉到了一个极高的位置。在大家的潜意识里,ChatGPT 就应该是一个无所不能的“超级大脑”,理应永远保持 95 分甚至 100 分的状态。

这就带来了一个残酷的心理效应:当一个长期考 95 分的优等生,突然有一次只考了 80 分,周围人的第一反应绝不是“他还在及格线以上”,而是“他怎么了?是不是退步了?”

相比之下,Gemini(及其前身 Bard)在早期给人的印象相对平淡,甚至因为一些滑稽的错误而被贴上“不够聪明”的标签。用户的初始预期可能只有 60 分或 70 分。因此,当 Gemini 做出一个 80 分的回答时,用户的感受是“哇,它进步了”,而不是“它怎么变笨了”。同样的输出质量,放在两个不同的产品身上,得到的评价却截然相反,这就是锚定效应在作祟。ChatGPT 输在了它曾经太优秀,导致任何微小的波动都被放大成了“事故”。

付费用户的严苛契约:花钱买的是“确定性”

另一个不可忽视的因素是付费模式带来的心理契约

ChatGPT 拥有庞大的 Plus 和 Pro 付费用户群。对于这部分用户而言,每月支付的订阅费不仅仅是一个数字,更是一份对服务稳定性的隐性契约。付费用户的核心诉求不仅仅是“强大”,更是“稳定”和“可预测”。

想象一下你去一家人均 500 元的高级餐厅。如果第一次去味道惊艳,你会觉得物超所值;但如果第二次去,发现菜品口味忽咸忽淡,甚至服务员响应变慢,你的愤怒值会远高于去一家平价快餐店遇到同样情况。在快餐店,你可能心想“反正便宜,凑合吃吧”;但在高级餐厅,你会觉得“我花了这么多钱,凭什么体验变差了?”

ChatGPT 的付费用户正是处于这种心态。当他们发现昨天还能完美解决的复杂逻辑题,今天突然变得含糊其辞,或者代码生成频繁出错时,那种“被背叛感”会迅速转化为对“降智”的指控。他们无法接受付费后服务质量的非线性波动。

反观 Gemini,虽然也有高级版本,但在大众认知中,其免费版的覆盖面更广,且很多用户并未将其作为核心生产力工具深度绑定。使用频率低、依赖程度低,自然也就少了一份“必须完美”的苛责。很多时候,用户甚至察觉不到 Gemini 的细微波动,因为它压根就没进入用户的高频工作流。

行业基准的诅咒:被拿着放大镜对比的“公敌”

ChatGPT 还有一个特殊的身份:行业基准(Benchmark)

在 AI 领域,几乎所有的新模型发布,第一件事就是拿 ChatGPT 来“祭旗”。开发者们习惯用一套固定的测试题(Prompt),先问一遍老版本的 GPT-4,再问一遍新模型,甚至过几天再问一遍现在的 ChatGPT,以此来验证优劣。

这种全行业的“找茬”行为,让 ChatGPT 处于一种极度透明的审视之下:

  • Claude 出来了,大家拿 ChatGPT 比;
  • Gemini 升级了,大家拿 ChatGPT 比;
  • 就连 ChatGPT 自己出了新版本,大家还要拿它和半年前的旧版本比。

在这种高强度的横向与纵向对比中,任何一点因模型路由策略调整、上下文窗口限制或临时算力波动导致的体验差异,都会被无限放大。用户并不关心后台是 MoE 架构的动态调度问题,还是 System Prompt 的膨胀导致了“对齐税”,他们看到的直观事实就是:“昨天能行,今天不行,肯定是降智了。”

而 Gemini 由于尚未完全成为所有人的“主力军”,很多人一周可能只用它一两次。这种低频使用就像备用手机,电量掉了 20% 可能半个月都发现不了。缺乏高频的深度交互,自然就少了那些关于“状态不稳定”的敏锐吐槽。

理性看待波动:是“变笨”还是“策略调整”?

当我们理解了上述心理机制,或许能对所谓的“降智”多一份理性。

大模型本质上是一个概率系统,而非确定性的计算器。同一个问题,受限于当前的服务器负载、动态路由策略(比如为了节省算力将简单问题分发给小参数模型)、以及安全过滤层的实时调整,输出结果出现波动是技术上的常态。

很多时候,并不是模型真的“变傻”了,而是产品在商业化、合规性与性能之间做出的动态平衡。例如,为了应对海量的并发请求,系统可能会在某些时段自动降低推理的深度;或者为了符合新的安全规范,模型被注入了更严格的系统指令,导致回答变得保守。

对于用户而言,意识到**“期待值管理”**的重要性至关重要。如果你将 ChatGPT 视为一个永远完美的神,那它每一次呼吸不均匀都会让你失望;但如果你理解它是一个复杂的、正在演进中的工程产品,接受它在极端场景下的不稳定性,或许能减少很多无谓的焦虑。

至于 Gemini,它目前的“宽容待遇”或许只是因为它还未真正承担起数亿用户核心工作流的重任。一旦有一天,它真的成为了程序员每天写代码、分析师每天处理数据的首选工具,并且开始大规模收费,相信届时关于它“降智”的讨论,也不会比今天的 ChatGPT 少多少。毕竟,被批评,往往是因为被需要;而被依赖,才最容不得沙子。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐